跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–2 条 · 共 2 条
今天10月1日周四
9月29日周二
  1. Simon Willison82

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。

    推荐理由:作者用同一提示词实测 Sonnet 5.5 的免费层表现,并给出与 Opus 5.5 的对比和成本数据。