Parallel 借助 GPT-6 Astra 将研究时间与成本减半
Parallel 的智能体借助 GPT-6 Astra 研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
Parallel 的智能体借助 GPT-6 Astra 研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整任务完成度打分,核心是考察智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作,同时成本降低 78%、准确率提升。
一名入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD 和工单均由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。管理层多次表示推送代码不是瓶颈,员工每天工作 12 到 13 小时只为按回车,没人阅读任何内容,团队无人喜欢这种状态。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成代码仍需阅读,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 打包经验,后者提供工具与数据的标准接入;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识与代码库上下文,减少 token 浪费并降低答案不完整的概率。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)按课程目标动态生成可交互的教学模拟,并内置分级挑战、提示与反馈等教学脚手架。
联合国系统发布 UN System Data Commons,一个基于 Google Data Commons 构建的开源平台,把分散的全球统计数据整合为单一可搜索的 AI-ready 知识图谱。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现问题并将判断力集中在最关键之处。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能能力,支持律所自定义工作流、接入法律数据源,并针对机密客户工作提供法律级管控。该产品归属于 OpenAI for Law。
NVIDIA 展示了一套智能体 AI 工作流,用于为物理 AI 系统准备和验证数字孪生:智能体可检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按 SimReady 要求验证结果。该流程覆盖从 Blender 场景到面向 NVIDIA 的仿真就绪 OpenUSD 交付。
OpenAI 发布新的 AI 广告体验,包括 Sponsored Agents 和面向营销人员的工具,并与 HubSpot、Shopify 完成集成。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,方便员工分享。
Salesforce 在 Dreamforce 上发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练,使用近三十年企业 CRM 部署数据构建的专有合成数据集。
推荐理由:Salesforce 首个 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 后训练,读者可了解其训练方式与落地节奏。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度多步推理任务。
推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入渠道,可据此判断语音智能体的可用性。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,将在 115 个国家举办超 800 场社区活动,由 Google Developer Groups 主办。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,打造出能整理收件箱、以用户本人语气起草邮件的 AI 行政助理。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化管线,原本手工花两天准备的活动现在从单个 Issue 自动完成搭建、每日筛选报名者并在结束后清理。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
Google Research 提出 ToolGrad,用文本“梯度”迭代构建 API 工作流,先产出真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂、通过率更高的数据。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需在编辑器、终端和浏览器之间切换即可审查、运行并预览 AI 智能体生成的代码改动。
Google Search 的 AI 功能可帮跑者备战比赛:在 AI Mode 中通过 Canvas 工具生成个性化训练计划,并可结合 YouTube Music 账号定制跑步歌单。选购装备时,Search 依托超过 600 亿商品列表的 Shopping Graph 提供定制推荐、库存对比和本地可用性。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接公司数据、发现洞察,并用自然语言借助 AI 构建交互式仪表盘。
OpenAI 发布 ChatGPT for Financial Services,内置金融数据并搭载 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:OpenAI 面向金融行业推出 ChatGPT 专用版本,读者可了解其内置金融数据与 GPT-6 Astra 的组合定位。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话通信支持。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音应用的接入门槛变化。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方给出 Agents API 的托管定位与 Codex harness 编排能力,可据此判断云端智能体的搭建方式。
Google Search 上线 Live Game Feed,搜索进行中的比赛即可看到实时战况、逐回合更新、视频集锦与 AI 洞察,该功能已在美国移动端英文上线,本月晚些时候将支持大学球队并扩展至更多地区。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 编写的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。迁移前先构建数值一致性校验框架,让 Fortran 导出状态快照供 C++ 测试比对;随后用 Vibe CLI 启动上百个智能体解析调用树并生成文档。最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移,兼顾代码质量与卡点解阻。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、电脑操作以及更强的写作与设计判断能力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,可据此了解其推理与电脑操作方向。
Google DeepMind 发布论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并给它们配备了公共公告板、私信和共享知识库。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存企业工作中的消息、决策、项目和待办事项等随时间变化的上下文。该智能体无需在每次启动时重建上下文,即可直接基于已有记忆参与工作。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 选用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量数据,可据此判断多模型编排在编码任务上的取舍。
GitHub Copilot 应用支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在会话视图中查看各任务标题与进度,随时切换而不必重新说明背景。官方建议先同时启动两个小任务来体验并行智能体会话。
NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体工作流:主智能体把复杂任务拆解并分派给专用子智能体,用户也可同时运行多个智能体会话,这种广度优先方式能加快任务完成速度。
Google DeepMind 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴提供受限访问,首批开放其最先进的网络安全模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender harness,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索和检查视频片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
NVIDIA 开发者博客介绍用 NVIDIA Nemotron 构建自适应智能体网络安全系统,让智能体在安全运营中协调工作并追求长周期复杂目标。现有许多实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将这些缺口转化为改进。