跳到正文
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,为智能体部署加装系统级安全层

    Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。

    推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 公布塞拉利昂 AI 学习试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。

5月19日周二
5月16日周六
  1. Google DeepMind22

    剑桥大学团队用 Co-Scientist 寻找跨物种传染病的分子开关

    剑桥大学教授 Clare Bryant 正用 Google DeepMind 的 Co-Scientist 寻找病原体跨物种传播引发脓毒症等重症的分子开关。Co-Scientist 从她的流感基金申请中生成并排序假设,优先锁定了一个她此前未关注的蛋白,并随数据补充将假设细化到具体氨基酸。Bryant 团队正构建携带氨基酸突变的细胞系验证,原本需两到三年的工作有望在六个月内完成。

  2. Google DeepMind28

    Google Co-Scientist 加速肝病机制发现,提出 MASH 组合疗法新假设

    爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。

  3. Google DeepMind36

    Google Co-Scientist 助力发现肝纤维化再利用药物,vorinostat 阻断 91% 损伤反应

    斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。

5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。

    推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。

5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的新范式

    伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。

5月6日周三
  1. Google DeepMind75

    DeepMind 详解 AlphaEvolve 一年成果:从基因组到 TPU 设计

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。

    推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。

4月30日周四
4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。

    推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。

4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。

3月13日周五
  1. Berkeley AI Research36

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。

1月10日周六
  1. Berkeley AI Research26

    Berkeley AI Research 提出信息驱动成像系统设计框架,登 NeurIPS 2025

    Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测解码器性能。该方法用已知噪声物理直接计算 H(Y|X),仅需学习 H(Y),优化后的设计在更少内存和算力、无需任务专用解码器的情况下达到与端到端方法相当的水平。