跳到正文
今天10月1日周四
  1. 钛媒体80

    谷歌发布 Gemini 4 Argon:18 项基准拿下 12 项第一,但终端操作落后

    谷歌发布新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,DeepSWE v1.1 得分 77.9%,Vals Index 得分 68.9%。

    推荐理由:梳理了 Gemini 4 Argon 的基准成绩、短板与定价,并提示自报分数需结合独立评测看待。

  2. The Verge · AI82

    Google 发布 Gemini 4 Argon,初期仅向可信网络安全人员开放

    Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全人员开放,Google 表示正参与美国政府的前沿模型预发布访问流程,并将逐步扩大访问范围。

    推荐理由:Google 发布 Gemini 4 Argon 并限制访问范围,读者可了解其能力定位与分阶段开放的安全考量。

9月30日周三
9月29日周二
  1. Simon Willison82

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。

    推荐理由:作者用同一提示词实测 Sonnet 5.5 的免费层表现,并给出与 Opus 5.5 的对比和成本数据。

  2. AWS Machine Learning Blog70

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。

9月23日周三