跳到正文
5月4日周一
5月2日周六
4月30日周四
4月27日周一
4月23日周四
  1. Google Research60

    Google Photos 上线 Auto frame 新功能,可自动改变照片拍摄视角

    Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,把照片理解为 3D 场景并自动调整相机位置和焦距,生成原本未拍到的视角。该方法分两步:先用内部 3D 点图估计模型重建人体和面部并估算焦距,再用生成式潜在扩散模型填补新视角下出现的空洞。该功能已面向含人物的照片自动提供重新构图版本,作为 Auto frame 候选中的第二个选项。

    推荐理由:原文拆解了 Google Photos 自动取景如何用 3D 场景估计加生成式补全改变拍摄视角,可了解生成式编辑的新思路。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。

    推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。

4月21日周二
  1. Google DeepMind22

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡达成合作,推动前沿 AI 在企业规模化落地。合作方将获得 Gemini 系列等前沿模型的早期访问权限,并围绕金融、制造、零售、媒体娱乐等行业共同开发行业专属 AI 方案。目前仅 25% 的组织成功将 AI 规模化投入生产。

4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。

4月16日周四
  1. Google Research34

    Google Research 用 AI 合成神经元加速脑图谱重建,错误率降低 4.4%

    Google Research 提出 MoGen 模型,通过点云流匹配生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。该团队称,在完整小鼠脑规模下,这一改进相当于节省 157 人年的手动校对工作。MoGen 已作为开源模型发布,论文将在 ICLR 2026 展示。

  2. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。

4月14日周二
4月13日周一
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计等复杂仪表。

    推荐理由:Gemini Robotics-ER 1.6 升级了空间推理与多视角理解,并新增仪表读数能力,可了解机器人在真实场景中的自主性进展。

4月9日周四
4月3日周五
  1. Google Research36

    Google 研究:25 个 LLM 的行为倾向与人类共识存在两类对齐缺口

    Google Research 提出评估 LLM 行为倾向对齐的框架,用改编自 IRI、ERQ 等心理量表的情境判断测试(SJT)评测 25 个 LLM,并与 550 名标注者的偏好分布对比。结果显示两类缺口:模型倾向偏离人类共识,且在人类无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。

4月1日周三
3月31日周二
  1. Google Research62

    Google Quantum AI 发布白皮书:量子计算机破解加密货币加密所需资源大幅下降

    Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密(ECDLP-256)所需的量子比特和门数比此前认为的更少。

    推荐理由:Google Quantum AI 更新了破解 ECDLP-256 所需的量子资源估算,并给出面向加密货币社区的 PQC 迁移与负责任披露建议。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 把自然语言变成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 官方给出 Vibe Coding XR 的完整工作流与 VCXR60 初步评测,可了解自然语言生成 XR 应用的实际成功率与限制。

3月24日周二
  1. Mistral AI71

    Mistral 发布 Voxtral TTS 语音模型,4B 参数支持 9 种语言

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

    推荐理由:Mistral 首款 TTS 模型给出参数规模、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断语音智能体的成本与选型。

3月18日周三
  1. Mistral AI67

    Mistral AI 推出 Forge,让企业用自有知识训练前沿模型

    Mistral AI 发布 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 同时支持 dense 和 MoE 架构,并可按需支持多模态输入,模型可在企业内部基础设施中训练与治理。官方称已与 ASML、Ericsson、欧洲空间局等机构合作,并支持 Mistral Vibe 等智能体用自然语言完成微调、调参与合成数据生成。

    推荐理由:Mistral 官方披露 Forge 的训练流程与架构支持,可据此判断企业自建前沿模型的门槛与路径。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一开源模型,读者可据此判断小模型统一化的取舍。

  2. Mistral AI65

    Mistral 发布开源代码智能体 Leanstral,面向 Lean 4 形式化证明

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并集成进 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出权重、API 与 FLTEval 评测,可据此判断形式化验证的成本变化。

3月13日周五
  1. Berkeley AI Research36

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。

3月12日周四
  1. Google Research69

    Google 在 Flood Hub 上线城市山洪预报,提前 24 小时预警

    Google 宣布在 Flood Hub 上线城市山洪预报,可提前最多 24 小时预测城市山洪风险。该模型基于 RNN 与 LSTM 架构,使用 Gemini 从公开新闻报道中提取历史山洪事件构建 Groundsource 数据集进行训练,目前以 20x20 公里分辨率运行,覆盖人口密度超过每平方公里 100 人的区域。

    推荐理由:Google 把城市山洪预警扩展到 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的方法与全球覆盖思路。

  2. Google Research60

    Google 推出 Groundsource,用 Gemini 将新闻报道转为灾害数据

    Google 发布 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害事件的方法,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,构建 260 万条历史数据集,并给出人工核验的准确率。

  3. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署 AMIE 做就诊前问诊,读者可了解其安全监督机制与诊断表现。

3月11日周三
2月5日周四
  1. Mistral AI71

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。

    推荐理由:Mistral 一次发布批量与实时两款语音转写模型,并给出延迟、错误率与价格对比,便于判断实时语音场景的可用性。

1月28日周三