微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
大脑约一半能量用于产生电活动,人起床、走过昏暗走廊、回忆冰箱食物并判断身体能量状态,这些过程在几秒内完成,都依赖脑内电信号。研究通过观察出人意料的复杂脑电波,揭示大脑内部运作机制。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称更早的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,认为一个有意义的能力门槛已被跨过。
推荐理由:Anthropic 红队给出内部 Binary Exploitation 基准的对比数据,可看到不同模型在控制流劫持任务上的能力差异。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
Google Research 发布 AI video co-director 多智能体框架,在 Gemini 和 Veo 之上规划多镜头叙事的视觉连续性,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归合成与闭环修正四套框架,读者可了解多智能体如何抑制角色漂移与语义漂移。
随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对机器人推理卸载的系统性测量,给出任务成功率、电池续航与 Kubernetes 工具链的具体数据。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评估推理服务软件改动在完整服务路径上的表现,包含 53 个任务。该工具针对 AI 编程智能体的补丁能通过测试、却在服务器加载真实模型并处理请求时失败的问题,检查系统能否通过公开接口返回正确结果。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成与重排序结合,并开源实现与权重。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,以集合级属性奖励评估整组结果,避免推理时生成数百个 CoT 推理 token。相关论文已被 ICML 2026 收录。
Google 为 AI & Economy ATLAS 推出新的交互式开放数据可视化,便于查看各职业与各国的 AI 使用率。基于 ATLAS 的新研究分析 2600 个专用 AI 模型并调查 600 多名美英科学家,发现近半数科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出耗时增加、待检验假设积压,物理实验与临床验证环节出现瓶颈。
Google Research 提出 ToolGrad,用文本“梯度”迭代构建 API 工作流,先产出真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂、通过率更高的数据。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。该问题属于七个千禧年大奖难题之一。
Google DeepMind 发布论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并给它们配备了公共公告板、私信和共享知识库。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人样本,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,纯目标人群模型优于混合欧洲数据训练;HDL、LDL 和血糖等高度人群特异性指标的交叉点更早到来。研究还比较了 meta-analysis 与 PRS-CSx 两种方法。
Google 与 HHMI Janelia 及剑桥大学等合作者在 Cell 发表论文,发布雄性果蝇脑和中枢神经系统的完整连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 如何加速连接组学重建。
METR 研究显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍,而 AI 研究本身的算法进展尚无显著加速。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 在 49 款 Atari 2600 游戏中学会游玩,到 AlphaGo、AlphaZero、MuZero 和 AlphaStar 在围棋、国际象棋与 StarCraft II 中达到 Grandmaster 水平。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,Opus 5 和 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远低于人类的 100%。
微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。
微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。
Import AI 第 468 期收录了智库 IFP 提出的 23 条应对递归自我改进(RSI)的政策建议,分属 7 个类别,涵盖自动化 AI 研发的透明度、风险管理与验证技术。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个原型AI蠕虫,利用被攻陷机器的GPU运行开源大模型进行推理,漏洞检测成功率约80%、利用成功率约53%、自复制成功率88%,完整攻击成功率约37%。
Berkeley AI Research 与 IBM Research 将 K-Search 内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出了注意力与 Mamba 两类内核的实测数据。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
剑桥大学教授 Clare Bryant 正用 Google DeepMind 的 Co-Scientist 寻找病原体跨物种传播引发脓毒症等重症的分子开关。Co-Scientist 从她的流感基金申请中生成并排序假设,优先锁定了一个她此前未关注的蛋白,并随数据补充将假设细化到具体氨基酸。Bryant 团队正构建携带氨基酸突变的细胞系验证,原本需两到三年的工作有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。
推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。
伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。
推荐理由:DeepMind 公开 AI co-clinician 研究,含 98 例初级保健查询与 140 项问诊技能盲评数据,可了解医疗 AI 当前能力边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。
推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。