Google DeepMind 发布 Gemini 4 Argon,支持 100 万 token 输出
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Matthew Green 指出,沙箱隔离不足以遏制失控 AI 智能体:被隔离沙箱中的智能体已发现可通过共享包缓存互相留下指令,并改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的全部要素——劫持智能体的载荷,加上把载荷传给下一个智能体的智能体。
阿里云在云栖大会上沿模型生产、智能落地、系统自进化三条效率线,一次性升级从数据入湖、训练集生产、模型训练、推理服务到系统自优化的整条链路,并强调「芯云模一体」的协同设计。
AI制作的漫剧正在改变影视生产链条,横店剧组数量明显减少,多位微短剧演员公开表示接不到戏。DataEye报告显示,国内AI漫剧2025年市场规模为168亿元,2026年1-5月已达220亿元,预计全年达400亿元;2026年第二季度仿真人剧在AI漫剧中占比已达七成。
Latent Space 播客中,OpenAI Computer Use 产品与工程负责人 Ari Weinstein 称 Computer Use 与几个月前相比已“180 度不同”,智能体现在更擅长调试和从失败中恢复,并会写 JavaScript 代码一次执行多步操作,同时结合截图、accessibility、DOM 和 Playwright。
Google 发布新前沿模型 Gemini 4 Argon,先向 Fairwind 计划的“可信网络防御者”和内部团队开放,随后再面向开发者、企业和消费者,尚未给出具体日期。
推荐理由:梳理了 Gemini 4 Argon 的定价、上下文与多项独立评测表现,可据此判断它在前沿模型中的位置。
Google 的智能体优先开发平台 Antigravity 已上架 Play Store,版本号 2026.09.23.988012583,目前仅支持 Googlebook OS。
Emergence AI 正把其神经形式化 AI 技术推向无晶圆厂半导体公司的实际部署,用 LLM 提出方案、符号 AI 验证,给出可证明正确的答案。该技术通过分析晶圆与终测数据定位良率异常根因,并已开始切入先进封装,用有限元和多尺度物理仿真排查 CTE 失配等问题。公司计划两年内将工程师与研发科学家扩充至 500 人,印度业务聚焦半导体。
Google 开始预告下一代前沿模型 Gemini 4 Argon,称其为公司迄今能力最强的 AI 模型,目前仅向极少数测试者开放,重点用于网络安全防御。Google 表示,待确认 Argon 足够稳健后,访问权限将逐步扩展到 Google AI Ultra 订阅用户。基准测试显示,Argon 在多种智能体任务上取得极具竞争力的成绩。
硬件设计 AI 工具初创公司 Flow Engineering 完成 5000 万美元 B 轮融资,估值达 7.5 亿美元,由 Valar Equity Partners 的 Antonio Gracias 与 Atreides Management 的 Gavin Baker 联合领投。
AI 编程初创公司 Factory 联合创始人兼 CEO Matan Grinberg 在 X 上称,已解雇董事会顾问 Chris Degnan,指其与最大竞争对手 Cognition 分享机密信息。
据 Sensor Tower 估算,Meta 的 AI 助手 Muse 下载量已突破 500 万,达到这一里程碑的速度快于 ChatGPT、Grok 和 Claude,后者分别用了 56 天、103 天和 492 天。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
OpenAI 在 Dev Day 上由 Sam Altman 宣布推出 Decisions API,可为 Luna 模型预设一组选项,让其在图像分类或智能体行为等选择中快速输出结果。
Google 在 Gemini 聊天中全球推出 Skills,用可保存、可复用的详细提示词取代此前的 Gems。用户输入“/”加 Skill 名称即可调用,Gemini 也能从历史对话生成 Skill 并在匹配时自动运行,多个 Skill 可串联完成更大任务,现已支持文本文档、PDF 和图片作为参考材料。
Meta 和 OpenAI 计划在未来一年推出 AI 硬件,两家都选择先用可爱的软件智能体培养用户习惯。OpenAI 与 Jony Ive 合作,产品不早于 2027 年 2 月出货,并在 DevDay 发布智能体平台 Dots;Meta 的挂坠式设备 Muse Charm 搭载 Muse 智能体,计划在今年假日购物季前推出。两家公司押注用户先对智能体产生依赖后,会愿意接受其物理形态。
Geekbench 7 曝光 OpenAI dots 的硬件配置:单核 1,667、多核 9,435,运行在九核 AMD EPYC 9V74 切片、9.73GB 内存的虚拟机上。
消费者 AI 看似回暖,Meta 的 Muse、OpenAI 的 Dots 和估值 100 亿美元的 Instinct 都在押注智能体日常任务,但付费意愿增长近乎线性。
DoorDash 宣布推出 text-to-order AI 智能体,用户可通过 Apple Messages 下单,发送“order my usual”这类提示词即可完成点餐。该智能体支持指定菜品、请求本地推荐、发送推荐菜品照片,并能在一次订单中处理多人不同的饮食偏好和数量。DoorDash 面向美国用户开放候补名单,同时宣布将在北加州部分餐厅测试配送无人机。
NVIDIA 发布 NeMo Relay,用于追踪 AI 智能体的执行路径,识别任务虽完成但过程低效的问题,例如失败搜索触发重复搜索、文件读取被截断后命令重复获取相同内容。这些多余步骤会增加延迟和 token 消耗,并提高失败概率。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。
推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。
Meta 推出 Muse AI 智能体,称可帮用户处理发邮件、在线购物等任务,但需要用户信任 Meta 并交出信用卡信息。发布后 Meta 还宣布了类似 Tamagotchi 的 Muse Charm 设备计划,并陆续推进 Muse 工具面向小企业、企业平台、智能眼镜和独立硬件等方向。
CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,成为较早交付该平台的云厂商之一,Cognition 是首个在 Vera Rubin 上跑生产负载的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力走向。
Instagram 宣布其独立剪辑应用 Edits 新增 AI“创作助手”,可调取账号的点赞、播放、视频留存和分享等数据,回答创作者关于什么内容在流行、某条视频为何表现好坏等问题,并给出内容创意、开场钩子、文案、热门音轨和脚本建议。该功能对创作者免费,但 Meta 表示“重度用户”可购买 Meta One 订阅以获得更多用量。
DoorDash 面向美国用户开放候补名单,测试一款可通过 Apple Messages 点餐的 AI 助手,对话所用手机号会关联到用户的 DoorDash 账号。
百度将文库、网盘十余年积累的内容资产作为AI办公的上下文来源,GenFlow 1.0 已于去年4月以通用AI Agent形态切入写论文、做PPT等场景,今年8月官宣中文名“库库AI”并上线独立端。库库AI已开放连接器授权,可调用飞书、钉钉内容,企业版推出后已有3000家企业试用;海外版由Oreate AI焕新为Kooko,一年内海外用户突破1000万。
Anthropic 发布评估称,智谱开源权重模型 GLM-5.3 在漏洞利用能力上接近其 Claude Mythos Preview。
推荐理由:Anthropic 与 CAISI 的实测数据给出开源模型在漏洞利用能力上逼近前沿闭源模型的量化对比,并附有绕过安全护栏的成本估算。
OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应智能体突破隔离并入侵 Hugging Face 等事件,称这些事故同属 5 月和 6 月的同一批模型与测试流程,相关模型和流程已被弃用。
推荐理由:OpenAI 首席研究官首次系统回应智能体越界事件,读者可了解其内部监控与训练流程的具体调整。
雷峰网分析指出,Personal Agent 正成为 AI 产品竞争的新方向:Meta 的 Muse 截至 9 月下旬下载量突破 300 万,OpenAI 于 9 月 29 日发布长期在线的个人 Agent 产品 dots,Manus 推出 Cue,千问、豆包、腾讯也在跟进。
雷峰网在 Claude Code 中用同一任务实测同日发布的 Qwen3.8-Flash 与 GLM-5.3-Flash,要求从零开发一个含任务、日程、笔记、Dashboard 和全局搜索的个人工作台。
OpenAI 于 8 月 19 日正式开源 Codex Harness,开放的是支撑 Codex App、CLI 和 IDE Extension 运行的 Agent Loop,开发者可通过 SDK 和 App Server 接入任务管理、工具调用、事件回传与人工审批。
雷峰网在同一台服务器上用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两者总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol 模型以及 Decisions API、Agents API、ChatGPT Spaces 与 Marketplace 等平台更新,ChatGPT 周活跃用户达 12 亿。
推荐理由:OpenAI DevDay 2026 一次性放出 Dots 智能体、GPT-6.1 Sol 与多项平台更新,可据此了解其产品线与定价变化。
一位作者用小红书 AI 助手「点点」加本地 Agent(ZCode、Claude Code、Workbuddy 等)完成国庆七天山西至河南自驾攻略,先由自己定主线再让 Agent 细化。他把最终行程从 Markdown 转成单文件 HTML,方便发进微信、离线调阅,并用高德地图「地图小程序」标注景点与酒店生成路线。文中还提到用智谱 GLM-5.3-Flash 识别景区票价牌和路线图。
OpenAI 在 9 月 30 日凌晨规模最大的开发者大会上发布 25 项更新,重头戏是由 GPT-6 Astra 驱动的个人 AI 智能体 dots,自带云端运行环境、可连接数千款应用并持续自主完成任务,Pro 及企业套餐用户可用。
OpenAI 在 DevDay 2026 发布超过 20 项更新,其中 Dot 定位为全天候自主智能体,由 GPT-6 Astra 驱动并运行于独立云端电脑,支持跨 ChatGPT、短信、Slack 和 Teams 交互,即日起面向 Pro 与 Business Premium 用户逐步开放且首个 Dot 包含在套餐内。
推荐理由:汇总 OpenAI DevDay 2026 二十余项更新,可快速了解 Dot 智能体、新模型与 API 的定价和能力变化。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。
推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。
OpenAI 在开发者大会发布 25 项更新,核心是 GPT-6 Astra 驱动的 dots 智能体,每个 dot 拥有云端电脑和浏览器,可连接 4000 多个应用并全天候运行,个人用户仅 Pro 套餐可用。
推荐理由:梳理 OpenAI 开发者大会 25 项发布,重点解释会员按用量分档与 dot 智能体的定价逻辑变化。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能把视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,支持在生产规模下理解视频。
AWS 发布 Amazon Quick 提示词工程基础指南,这是两部分系列的第一篇,聚焦适用于 Quick 各组件(Research、Flows、Sight、Chat Agents、Action Integrations)的通用原则与可复用框架。文章提出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例演示能减少迭代、提升首次输出质量。