Import AI 457:AI 版 Stuxnet、Muon 优化器致神经元死亡与正向对齐
SentinelOne 拆解了 20 多年前的病毒 fast16.sys,它通过篡改内存中高精度计算软件的结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等工程仿真工具。
SentinelOne 拆解了 20 多年前的病毒 fast16.sys,它通过篡改内存中高精度计算软件的结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等工程仿真工具。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,可据此判断智能体在科研流程中的落地方式。
Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡推出医疗、科研、教育和气候等领域的新项目。合作探索 AI co-clinician 辅助诊疗,并用 AlphaFold、Google Earth 等工具推进东南亚传染病与疫情防控研究,同时向中小学至初级学院全体教育者提供 Gemini for Education。
剑桥大学教授 Clare Bryant 正用 Google DeepMind 的 Co-Scientist 寻找病原体跨物种传播引发脓毒症等重症的分子开关。Co-Scientist 从她的流感基金申请中生成并排序假设,优先锁定了一个她此前未关注的蛋白,并随数据补充将假设细化到具体氨基酸。Bryant 团队正构建携带氨基酸突变的细胞系验证,原本需两到三年的工作有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转为可检验假设并按可行性与风险收益排序研究方向。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实际表现,读者可了解 AI 天气模型如何辅助官方预警决策。
Import AI 作者 Jack Clark 判断,到 2028 年底前有 60% 以上概率出现无需人类参与的 AI 研发,即 AI 系统能自主训练出自己的后继版本。
Google Research 公布其开源工具与开放数据集已支持全球超 25 万名研究者和开发者。其基因组学工具 DeepVariant、DeepConsensus 和 DeepPolisher 已帮助全球处理 250 万人的外显子组和全基因组,与 UCSC 合作将遗传变异识别错误降低 50%。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四个真实科研案例,覆盖流行病预测、宇宙学、气候监测和神经科学。
推荐理由:四个跨领域案例展示了 ERA 如何从预测建模延伸到可解释的机制发现,可了解 AI 辅助科研的具体落地方式。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型,首批合作机构包括首尔大学、KAIST 及该部的三个 AI Bio Innovation Hubs。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。
推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功与失败经验中提炼结构化推理记忆的智能体框架,配合 memory-aware test-time scaling(MaTTS)实现测试时自我进化。
Google Research 提出合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,从第一性原理生成数据集,无需种子数据。
Google Research 提出 MoGen 模型,通过点云流匹配生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。该团队称,在完整小鼠脑规模下,这一改进相当于节省 157 人年的手动校对工作。MoGen 已作为开源模型发布,论文将在 ICLR 2026 展示。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中提出,AI 评测常用的每项 1-5 名标注者往往不足,要反映人类意见差异常需每项超过 10 名标注者。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其原理与实测结果。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 网格划分与特征栅格化,把道路、建筑、商铺等建成环境数据转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 用于乳腺筛查的表现与流程整合。
推荐理由:两项 Nature Cancer 研究给出 AI 参与乳腺筛查的具体检测率与读片量变化,可了解人机协作流程的实际收益与局限。
Mistral AI 发布 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 同时支持 dense 和 MoE 架构,并可按需支持多模态输入,模型可在企业内部基础设施中训练与治理。官方称已与 ASML、Ericsson、欧洲空间局等机构合作,并支持 Mistral Vibe 等智能体用自然语言完成微调、调参与合成数据生成。
推荐理由:Mistral 官方披露 Forge 的训练流程与架构支持,可据此判断企业自建前沿模型的门槛与路径。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划共同开发前沿开源 AI 模型,结合 Mistral AI 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。
Google 宣布在 Flood Hub 上线城市山洪预报,可提前最多 24 小时预测城市山洪风险。该模型基于 RNN 与 LSTM 架构,使用 Gemini 从公开新闻报道中提取历史山洪事件构建 Groundsource 数据集进行训练,目前以 20x20 公里分辨率运行,覆盖人口密度超过每平方公里 100 人的区域。
推荐理由:Google 把城市山洪预警扩展到 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的方法与全球覆盖思路。
Google 发布 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害事件的方法,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,构建 260 万条历史数据集,并给出人工核验的准确率。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测解码器性能。该方法用已知噪声物理直接计算 H(Y|X),仅需学习 H(Y),优化后的设计在更少内存和算力、无需任务专用解码器的情况下达到与端到端方法相当的水平。
一篇新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
Mistral 通过 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)的 8000 训练样本与 2000 测试样本上显著优于未微调基线。
Mistral AI 与 Carbone 4、ADEME 合作完成首个 AI 模型全生命周期分析,并披露 Mistral Large 2 截至 2025 年 1 月的环境影响:训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281000 m³ 水和 660 kg Sb eq。
Andrew Ng 在 IEEE Spectrum 专访中提出,AI 的下一个重要转向是"以数据为中心",用"小数据"方案解决模型效率、准确率和偏见问题。他认为大模型扩展仍适用于 NLP 和视频等场景,但许多行业并不存在海量数据集,50 个精心设计的样本就可能足够训练神经网络。他目前通过 Landing AI 的 LandingLens 平台,用计算机视觉帮助制造业改进视觉检测。
MathWorks 的 MATLAB 平台高级产品经理 Heather Gorr 阐述了 AI 在芯片设计与制造全流程中的作用,包括缺陷检测、异常检测与故障缓解、计划与非计划停机分析。她指出,用代理模型替代计算密集的物理建模可加速参数扫描与 Monte Carlo 仿真,从而降低成本,但这类 AI 模型精度不及物理模型,且建模依赖来自多种传感器和团队的数据。