Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
NVIDIA 发布 NeMo Relay,用于追踪 AI 智能体的执行路径,识别任务虽完成但过程低效的问题,例如失败搜索触发重复搜索、文件读取被截断后命令重复获取相同内容。这些多余步骤会增加延迟和 token 消耗,并提高失败概率。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。
推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。
CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,成为较早交付该平台的云厂商之一,Cognition 是首个在 Vera Rubin 上跑生产负载的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力走向。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。
推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能把视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,支持在生产规模下理解视频。
AWS 发布 Amazon Quick 提示词工程基础指南,这是两部分系列的第一篇,聚焦适用于 Quick 各组件(Research、Flows、Sight、Chat Agents、Action Integrations)的通用原则与可复用框架。文章提出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例演示能减少迭代、提升首次输出质量。
AWS 发文拆解 Amazon Quick 各组件的提示词写法差异:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定来源(Quick Index。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台方案,用 AI 智能体从合同 PDF 中提取八个关键字段并交叉验证,解决 RAG 语义检索无法跨数百份合同做聚合统计的问题。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、计算机操作和专业工作,具备接近 Astra 的智能水平。其标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,官方给出与 Astra 的定位和价格对比,可据此判断其性价比取向。
OpenAI 发布 DevDay 2026 回顾,汇总超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文为摘要,未给出各项更新的具体细节。
推荐理由:OpenAI DevDay 2026 一次性放出 20 多项发布,可据此快速了解 GPT-6 Astra、Codex 与 API 的更新范围。
OpenAI 发布 dots,将其定位为可跨复杂项目与日常任务持续工作的主动型助手。官方说明 dots 在推进工作的同时让用户保持控制权。
推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,可据此判断这类主动型助手与现有助手的分工。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。
AWS 发布基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时推出 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可运行在桌面、网页、Android、代码沙箱和企业 API 上。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用型 computer-use 智能体的成本与能力边界。
NVIDIA 发布 NVIDIA Open Agent Safety Platform,由开源软件 NVIDIA OpenShell 与 NVIDIA Sentry 参考系统设计组成,覆盖运行智能体的软件、硬件、算力与机器人系统。
推荐理由:NVIDIA 把智能体安全边界从模型层移到运行时与硬件层,读者可据此了解企业级智能体治理的一种新架构。
NVIDIA 发布开放智能体安全平台,为持续在硅智能体监控提供参考方案。该平台面向智能体 AI 的安全监控需求,类比 90 年代互联网兴起带来的机遇与风险。原文未披露具体功能、版本或性能数字。
NVIDIA 发布 OpenShell,为 AI 智能体提供运行时控制能力。该工具面向需要访问工作区、计算资源、数据、凭证和外部服务的智能体,支持其持续数天或数周执行调查软件故障、运行实验等任务。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。
GitHub Copilot 提出聊天并非与 AI 协作的最佳界面,其应用内的 canvas 是可运行完整全栈应用的交互面板,能与 Copilot 智能体双向通信并调用第三方 API、在本地执行代码。文中演示了用 canvas 构建 Connect 4 游戏、Winget 包管理界面和 SQLite 操作界面,并称工作流自动化 canvas 花了大半天才调好设计与自动化。
Google Research 发布 AI video co-director 多智能体框架,在 Gemini 和 Veo 之上规划多镜头叙事的视觉连续性,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归合成与闭环修正四套框架,读者可了解多智能体如何抑制角色漂移与语义漂移。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体便会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分类并生成漏洞报告。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上加入近实时视频生成,让对话模型具备能听、能看、能说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的形态变化。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最高 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
Harvey 借助 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文书,让律师得以专注于策略。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 进展,新加坡 HTX 将用 NVIDIA Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队排查 bug、设计系统并加快交付。该消息由 OpenAI 公布,但未披露具体接入方式、覆盖团队规模或性能数据。
Parallel 的智能体借助 GPT-6 Astra 研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整任务完成度打分,核心是考察智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作,同时成本降低 78%、准确率提升。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成代码仍需阅读,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 打包经验,后者提供工具与数据的标准接入;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识与代码库上下文,减少 token 浪费并降低答案不完整的概率。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)按课程目标动态生成可交互的教学模拟,并内置分级挑战、提示与反馈等教学脚手架。
联合国系统发布 UN System Data Commons,一个基于 Google Data Commons 构建的开源平台,把分散的全球统计数据整合为单一可搜索的 AI-ready 知识图谱。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现问题并将判断力集中在最关键之处。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能能力,支持律所自定义工作流、接入法律数据源,并针对机密客户工作提供法律级管控。该产品归属于 OpenAI for Law。
NVIDIA 展示了一套智能体 AI 工作流,用于为物理 AI 系统准备和验证数字孪生:智能体可检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按 SimReady 要求验证结果。该流程覆盖从 Blender 场景到面向 NVIDIA 的仿真就绪 OpenUSD 交付。
OpenAI 发布新的 AI 广告体验,包括 Sponsored Agents 和面向营销人员的工具,并与 HubSpot、Shopify 完成集成。