谷歌发布 Gemini 4 Argon:18 项基准拿下 12 项第一,但终端操作落后
谷歌发布新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,DeepSWE v1.1 得分 77.9%,Vals Index 得分 68.9%。
推荐理由:梳理了 Gemini 4 Argon 的基准成绩、短板与定价,并提示自报分数需结合独立评测看待。
谷歌发布新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,DeepSWE v1.1 得分 77.9%,Vals Index 得分 68.9%。
推荐理由:梳理了 Gemini 4 Argon 的基准成绩、短板与定价,并提示自报分数需结合独立评测看待。
同一句"让机器人满行程转一遍"的模糊指令下,GPT-6 Astra、Claude Fable 5.1 和 GPT-5.6 Sol 都让两轴云台转了起来,但完成标准差异明显。
Google 发布新前沿模型 Gemini 4 Argon,先向 Fairwind 计划的“可信网络防御者”和内部团队开放,随后再面向开发者、企业和消费者,尚未给出具体日期。
推荐理由:梳理了 Gemini 4 Argon 的定价、上下文与多项独立评测表现,可据此判断它在前沿模型中的位置。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全人员开放,Google 表示正参与美国政府的前沿模型预发布访问流程,并将逐步扩大访问范围。
推荐理由:Google 发布 Gemini 4 Argon 并限制访问范围,读者可了解其能力定位与分阶段开放的安全考量。
Anthropic 发布评估称,智谱开源权重模型 GLM-5.3 在漏洞利用能力上接近其 Claude Mythos Preview。
推荐理由:Anthropic 与 CAISI 的实测数据给出开源模型在漏洞利用能力上逼近前沿闭源模型的量化对比,并附有绕过安全护栏的成本估算。
Anthropic 的 Opus 5.5 本周发布后,社区反馈集中在用代码生成解说视频上,SimpleBench 得分 88.4%,在 Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者用同一提示词实测 Sonnet 5.5 的免费层表现,并给出与 Opus 5.5 的对比和成本数据。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了同日发布的四款新模型,并给出完整价格对比表,可据此判断这轮降价对应用成本的影响。