谷歌发布 Gemini 4 Argon:18 项基准拿下 12 项第一,但终端操作落后
谷歌发布新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,DeepSWE v1.1 得分 77.9%,Vals Index 得分 68.9%。
推荐理由:梳理了 Gemini 4 Argon 的基准成绩、短板与定价,并提示自报分数需结合独立评测看待。
谷歌发布新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,DeepSWE v1.1 得分 77.9%,Vals Index 得分 68.9%。
推荐理由:梳理了 Gemini 4 Argon 的基准成绩、短板与定价,并提示自报分数需结合独立评测看待。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google 母公司 Alphabet 发布 Gemini 4 Argon,可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证并修补关键软件漏洞。
Google 发布新前沿模型 Gemini 4 Argon,先向 Fairwind 计划的“可信网络防御者”和内部团队开放,随后再面向开发者、企业和消费者,尚未给出具体日期。
推荐理由:梳理了 Gemini 4 Argon 的定价、上下文与多项独立评测表现,可据此判断它在前沿模型中的位置。
Google 开始预告下一代前沿模型 Gemini 4 Argon,称其为公司迄今能力最强的 AI 模型,目前仅向极少数测试者开放,重点用于网络安全防御。Google 表示,待确认 Argon 足够稳健后,访问权限将逐步扩展到 Google AI Ultra 订阅用户。基准测试显示,Argon 在多种智能体任务上取得极具竞争力的成绩。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全人员开放,Google 表示正参与美国政府的前沿模型预发布访问流程,并将逐步扩大访问范围。
推荐理由:Google 发布 Gemini 4 Argon 并限制访问范围,读者可了解其能力定位与分阶段开放的安全考量。
Google 宣布 Gemini 4 Argon AI 模型,但目前用户无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
Google 发布新前沿模型 Gemini 4 Argon,面向复杂长程工作流的深度推理,输出 token 上限从 64K 提升到 1M,并扩展了编码、推理和多模态能力。
推荐理由:Google 新前沿模型把输出上限提到 1M token,并给出编码、安全与内部落地数据,可据此判断长程推理的实用边界。
Anthropic 的 Opus 5.5 本周发布后,社区反馈集中在用代码生成解说视频上,SimpleBench 得分 88.4%,在 Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上加入近实时视频生成,让对话模型具备能听、能看、能说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的形态变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与安全水印的具体能力,可据此判断语音生成工作流的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度多步推理任务。
推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入渠道,可据此判断语音智能体的可用性。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,可直接学习实时卫星观测数据,每小时生成一次预报。
推荐理由:WeatherNext 3 用实时卫星数据替代 NWP 训练源,读者可据此理解 AI 天气预报在分辨率与更新频率上的路线变化。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和智能体最强的主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:Gemini 3.7 Flash 在编码与智能体任务上的基准提升和半价定价,可供开发者评估迁移成本。
Google DeepMind 发布多语种手语转文本模型 SL2T,在 Pixel 11 的 Gboard 和 Live Transcribe 中提供手语听写功能,首发支持美国手语(ASL)转英文,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译模型落到 Gboard 与 Live Transcribe,读者可了解其数据规模、隐私设计与基准表现。
Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:WeatherNext 在气旋路径与强度预测上多出约一天预警时间,并开源模型权重,读者可据此判断 AI 天气预报的可用边界。
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,理解物理世界、规划多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断具身推理模型的当前水位。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更复杂自然的旋律结构、更高的提示词遵循度与结构感知、更具情感和发音更准的人声,以及对节奏和时长的更便捷控制。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、高级灵巧操作和多机器人协作。
推荐理由:Google DeepMind 发布 Gemini Robotics 2 系列模型,读者可了解机器人在全身控制、灵巧操作与多机协作上的能力边界。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:原文给出 Gemini 3.5 Flash Cyber 的基准表现与限量开放方式,读者可据此判断轻量安全模型的落地路径。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布 Gemini 3.5 Live Translate,读者可了解其连续语音翻译机制与在 Google 产品中的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首批上线渠道。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计等复杂仪表。
推荐理由:Gemini Robotics-ER 1.6 升级了空间推理与多视角理解,并新增仪表读数能力,可了解机器人在真实场景中的自主性进展。