微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:Google DeepMind 把 SynthID 水印扩展到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
Google Research 发布 AI video co-director 多智能体框架,在 Gemini 和 Veo 之上规划多镜头叙事的视觉连续性,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归合成与闭环修正四套框架,读者可了解多智能体如何抑制角色漂移与语义漂移。
随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对机器人推理卸载的系统性测量,给出任务成功率、电池续航与 Kubernetes 工具链的具体数据。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评估推理服务软件改动在完整服务路径上的表现,包含 53 个任务。该工具针对 AI 编程智能体的补丁能通过测试、却在服务器加载真实模型并处理请求时失败的问题,检查系统能否通过公开接口返回正确结果。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成与重排序结合,并开源实现与权重。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)按课程目标动态生成可交互的教学模拟,并内置分级挑战、提示与反馈等教学脚手架。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,以集合级属性奖励评估整组结果,避免推理时生成数百个 CoT 推理 token。相关论文已被 ICML 2026 收录。
Google 为 AI & Economy ATLAS 推出新的交互式开放数据可视化,便于查看各职业与各国的 AI 使用率。基于 ATLAS 的新研究分析 2600 个专用 AI 模型并调查 600 多名美英科学家,发现近半数科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出耗时增加、待检验假设积压,物理实验与临床验证环节出现瓶颈。
Google Research 提出 ToolGrad,用文本“梯度”迭代构建 API 工作流,先产出真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂、通过率更高的数据。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。该问题属于七个千禧年大奖难题之一。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人样本,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,纯目标人群模型优于混合欧洲数据训练;HDL、LDL 和血糖等高度人群特异性指标的交叉点更早到来。研究还比较了 meta-analysis 与 PRS-CSx 两种方法。
Google 与 HHMI Janelia 及剑桥大学等合作者在 Cell 发表论文,发布雄性果蝇脑和中枢神经系统的完整连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 如何加速连接组学重建。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 在 49 款 Atari 2600 游戏中学会游玩,到 AlphaGo、AlphaZero、MuZero 和 AlphaStar 在围棋、国际象棋与 StarCraft II 中达到 Grandmaster 水平。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。
微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨软件工程、网页导航和个人助理任务复用环境、数据管线与评测流程。
推荐理由:微软研究院开源 Orchard 框架,给出环境服务、训练配方与数据,读者可了解小模型在真实任务上的训练路径。
Berkeley AI Research 与 IBM Research 将 K-Search 内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出了注意力与 Mamba 两类内核的实测数据。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。
Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。
推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google DeepMind 发布博客介绍,生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 辅助逆转细胞衰老研究。
推荐理由:Google DeepMind 官方披露 Co-Scientist 在衰老研究中的实际用法,读者可看到 AI 如何压缩文献筛选与数据分析周期。
剑桥大学教授 Clare Bryant 正用 Google DeepMind 的 Co-Scientist 寻找病原体跨物种传播引发脓毒症等重症的分子开关。Co-Scientist 从她的流感基金申请中生成并排序假设,优先锁定了一个她此前未关注的蛋白,并随数据补充将假设细化到具体氨基酸。Bryant 团队正构建携带氨基酸突变的细胞系验证,原本需两到三年的工作有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。
推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。
伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。
推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。
推荐理由:DeepMind 公开 AI co-clinician 研究,含 98 例初级保健查询与 140 项问诊技能盲评数据,可了解医疗 AI 当前能力边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。
推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。