跳到正文
今天10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。

    推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。

9月28日周一
9月26日周六
9月24日周四
  1. NVIDIA Developer Blog31

    NVIDIA 推出 NV-Reason-CT Open 3D CT VLM,面向放射科医生链式推理

    NVIDIA 发布 NV-Reason-CT Open,这是一款面向 3D CT 扫描的开放视觉语言模型,支持放射科医生的链式推理(Chain-of-Thought)。现有通用前沿模型在体数据成像上表现不佳,多数开放医学 AI 模型也缺乏相关能力,而 3D CT 这一临床信息最丰富、数据最密集的模态长期被现代 VLM 忽视。

9月23日周三
  1. OpenAI News60

    OpenAI 为 GPT-6 改进提示词缓存

    OpenAI 宣布为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。官方称这些改动用于减少延迟与费用,具体用法和参数未在摘要中给出。

    推荐理由:官方说明 GPT-6 提示词缓存的变化,读者可据此了解缓存命中率与延迟成本控制的新入口。

9月22日周二
9月19日周六
9月17日周四
  1. NVIDIA Developer Blog42

    NVIDIA TensorRT Edge-LLM 在 Jetson AGX Thor 上以 6.4 倍速度完成 MLPerf Edge Agentic Benchmark

    NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该方案面向从云端数据中心迁移到车辆、机器人等边缘设备的 AI 智能体,针对其多步骤工具调用、结果评估与长对话推理带来的边缘推理新需求,实现快速 token 生成。

9月16日周三
  1. NVIDIA Newsroom67

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。

  2. Google Research34

    Google Research 提出 Retrieve-for-Train:用离线 RL 编译扩散检索器,绕过查询扇出推理瓶颈

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,以集合级属性奖励评估整组结果,避免推理时生成数百个 CoT 推理 token。相关论文已被 ICML 2026 收录。

9月11日周五
9月10日周四
9月9日周三
9月8日周二
9月5日周六
9月3日周四
8月21日周五
  1. NVIDIA Developer Blog62

    NVIDIA AVO 在 ARC-AGI-3 上达到 100%

    NVIDIA 宣布其 AVO 在 ARC-AGI-3 上达到 100%,称其展示了面向长时程自主智能体的前沿级通用架构。文章指出前沿语言模型只是 AI 智能体的一部分,外围的 harness 决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中保持进展。

    推荐理由:NVIDIA 公布 AVO 在 ARC-AGI-3 上的成绩,读者可了解其面向长时程自主智能体的架构思路。

8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理短板

    微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。

8月12日周三
  1. Microsoft Research34

    微软研究院发布 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量

    微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。

7月26日周日
  1. Berkeley AI Research38

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。

6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。

5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的新范式

    伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。

4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。

3月13日周五
  1. Berkeley AI Research36

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。