Google Research 研究:推理如何解锁 LLM 的参数化知识
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法触及的参数化知识,即使面对简单单跳事实问题。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:计算缓冲效应(用无意义文本填充推理长度也能提升召回)和事实启动(生成相关事实为正确答案做语义预热)。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法触及的参数化知识,即使面对简单单跳事实问题。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:计算缓冲效应(用无意义文本填充推理长度也能提升召回)和事实启动(生成相关事实为正确答案做语义预热)。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可了解其能力边界与配套安全机制。
Google DeepMind 宣布与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,共同开发一款 AI 规划原型工具,目标是帮助规划官员将住宅规划申请的决定时间缩短 50%。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 的栅格地图转为树篱、石墙和矮林的可用生态清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征低于 0.5)区分林地、树丛与树篱。
Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。
推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。
Google Research 公布两项关于 AI 辅助皮肤问题理解的研究,其中发表于 JAMA Dermatology 的论文让 2,345 名参与者分别使用标准搜索、AI 工具和"Wizard of Oz"工具,AI 组尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,约为对照组 8% 的近三倍。
加州大学圣地亚哥分校在 Google 支持下,将用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名研究人员和学生提供低成本、低碳的云计算。手机主板约占整机隐含碳的 50%,SPEC 基准显示 25-50 台手机算力相当于一台现代服务器,20 台手机集群已能支撑 75 人以上课程的评分负载且延迟低于 AWS 默认后端。该系统预计 2026 年秋季上线。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并在 Google.org 支持下发起最高 1000 万美元的多智能体 AI 安全研究资助,面向全球研究者征集提案。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布 Gemini 3.5 Live Translate,读者可了解其连续语音翻译机制与在 Google 产品中的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家早期机器人初创,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,包括挪威 3D-Components、法国 Bubble Robotics、英国 Touchlab 等。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google 在 Gemini Enterprise Agent Platform 推出基于 Agentic RAG 的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 和 Sufficient Context Agent 等角色协作处理多源多跳查询。
Google 在 Nature 发表 PHRM 研究系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习估算心率,与 ECG 相比 MAPE 低于 10%,覆盖所有肤色。
推荐理由:Google 用手机前摄在解锁后被动测心率,论文给出跨肤色误差数据与公开数据集,可了解 rPPG 落地进展。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
Google Research 在 I/O 2026 上公布多项进展,包括面向科研的 Gemini for Science 工具套件、智能体开发平台 Antigravity 2.0,以及量子计算与健康 AI 方向的新成果。
推荐理由:Google Research 在 I/O 2026 集中披露 Gemini for Science、Antigravity 2.0 与量子计算等进展,可一览其研究到产品的转化路径。
Google 为隐私分析服务推出零信任聚合方案,结合新型单次消息加密聚合协议与 TEE,让设备无需多轮在线即可安全提交数据。该设计使 Google 只能获得人群的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。
Google DeepMind 在亚太地区推出首个加速器项目,聚焦“AI for the Planet”,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助把前沿 AI 与科学 AI 模型集成进其项目或产品,覆盖自然、气候、农业、能源等领域。项目以在新加坡举办的线下训练营启动,现已开放意向登记。
Google 发布基于 Gemini 的科研工具 Empirical Research Assistance(ERA),可搜索文献、编写并优化科学代码,相关成果已发表于 Nature。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可了解 AI 写科学代码在流行病预测、径流预报等领域的实际表现。
Google DeepMind 发布博客介绍,生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 辅助逆转细胞衰老研究。
推荐理由:Google DeepMind 官方披露 Co-Scientist 在衰老研究中的实际用法,读者可看到 AI 如何压缩文献筛选与数据分析周期。
Google DeepMind 在 Project Genie 中推出 Street View grounding 能力,用户可选取美国境内的真实地点并搭配风格,生成以真实影像为起点的可交互世界。
推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点为智能体提供环境。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首批上线渠道。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,可据此判断智能体在科研流程中的落地方式。
Google 宣布把内容透明度与验证工具扩展到 Search、Gemini、Chrome、Pixel 和 Cloud。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini、Chrome 和 Pixel,读者可据此判断内容溯源工具的可用范围。
Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡推出医疗、科研、教育和气候等领域的新项目。合作探索 AI co-clinician 辅助诊疗,并用 AlphaFold、Google Earth 等工具推进东南亚传染病与疫情防控研究,同时向中小学至初级学院全体教育者提供 Gemini for Education。
剑桥大学教授 Clare Bryant 正用 Google DeepMind 的 Co-Scientist 寻找病原体跨物种传播引发脓毒症等重症的分子开关。Co-Scientist 从她的流感基金申请中生成并排序假设,优先锁定了一个她此前未关注的蛋白,并随数据补充将假设细化到具体氨基酸。Bryant 团队正构建携带氨基酸突变的细胞系验证,原本需两到三年的工作有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转为可检验假设并按可行性与风险收益排序研究方向。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实际表现,读者可了解 AI 天气模型如何辅助官方预警决策。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。
推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。
推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。
Google Research 公布其开源工具与开放数据集已支持全球超 25 万名研究者和开发者。其基因组学工具 DeepVariant、DeepConsensus 和 DeepPolisher 已帮助全球处理 250 万人的外显子组和全基因组,与 UCSC 合作将遗传变异识别错误降低 50%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。
推荐理由:DeepMind 公开 AI co-clinician 研究,含 98 例初级保健查询与 140 项问诊技能盲评数据,可了解医疗 AI 当前能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四个真实科研案例,覆盖流行病预测、宇宙学、气候监测和神经科学。
推荐理由:四个跨领域案例展示了 ERA 如何从预测建模延伸到可解释的机制发现,可了解 AI 辅助科研的具体落地方式。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型,首批合作机构包括首尔大学、KAIST 及该部的三个 AI Bio Innovation Hubs。