跳到正文
今天10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。

    推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。

9月30日周三
  1. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。

    推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。

9月29日周二
  1. OpenAI News82

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、计算机操作和专业工作,具备接近 Astra 的智能水平。其标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,官方给出与 Astra 的定位和价格对比,可据此判断其性价比取向。

  2. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。

  3. AWS Machine Learning Blog70

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。

9月28日周一
9月26日周六
9月23日周三
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:读代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成代码仍需阅读,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 打包经验,后者提供工具与数据的标准接入;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识与代码库上下文,减少 token 浪费并降低答案不完整的概率。

9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。

9月12日周六
9月11日周五
9月9日周三
  1. Mistral AI40

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 编写的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。迁移前先构建数值一致性校验框架,让 Fortran 导出状态快照供 C++ 测试比对;随后用 Vibe CLI 启动上百个智能体解析调用树并生成文档。最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移,兼顾代码质量与卡点解阻。

9月8日周二
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 选用。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量数据,可据此判断多模型编排在编码任务上的取舍。

9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。

    推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。

8月27日周四
  1. NVIDIA Developer Blog62

    阿里发布 Qwen3.8-Flash-Next 权重,预览 Qwen4 架构

    阿里发布 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览,供开发者实验和评估。该模型是多模态 MoE 模型,主模型 125B 参数,另有 51B N-gram 嵌入向量,每 token 激活 6B 参数,原生上下文窗口 262,144 token,可扩展至 1M token。NVIDIA 开发者博客介绍了在 GB300 NVL72 上针对智能体编码的实验。

    推荐理由:阿里开放 Qwen3.8-Flash-Next 权重供开发者试用,可据此了解 Qwen4 架构预览版的 MoE 规格与长上下文能力。

8月14日周五
7月21日周二
7月17日周五
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。

5月6日周三
  1. Google DeepMind75

    DeepMind 详解 AlphaEvolve 一年成果:从基因组到 TPU 设计

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。

    推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。