跳到正文
8月28日周五
8月27日周四
  1. Google Research32

    Google 发布 GlucoFM:面向连续血糖监测的双流基础模型

    Google 推出自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 477 条受试者/会话记录,在 4 个队列、7 项临床任务共 14 组评估中平均 PR-AUC 较最佳 GluFormer 变体高 5.8 个百分点,并在 Dexcom 与 Libre 两款设备上取得最低 MAE。

8月25日周二
8月22日周六
  1. Google Research40

    Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物

    Google 发布 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物筛选组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,例如睡眠时长变异性与 PHQ-8 严重度的关联(ρ = 0.252)。

8月21日周五
  1. Microsoft Research34

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已集成进 CP2K

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。

8月19日周三
  1. Hugging Face Blog62

    IBM Research 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,提出智能体记忆不是开关而是需要按模型校准的剂量:强模型适合注入完整指南集,较弱模型适合高置信核心加按任务检索,已饱和模型没有可测收益。

    推荐理由:八款模型上的对照实验显示,智能体记忆的注入量需按模型能力校准,检索式注入还能同时压低成本。

8月17日周一
8月14日周五
8月13日周四
  1. Hugging Face Blog67

    Hugging Face 用编码智能体复现 ICML 2026 的 2226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文的 34%。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出可核查的复现率与证伪案例。

8月12日周三
  1. Google Research60

    Google Research 提出知识画像框架:事实性瓶颈在召回而非编码

    Google Research 发布研究,提出知识画像框架,将事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2150 条 Wikipedia 事实的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识调用而非知识缺失。

  2. Microsoft Research34

    微软研究院发布 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量

    微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。

8月10日周一
8月4日周二
7月31日周五
7月26日周日
  1. Berkeley AI Research38

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。

7月23日周四
7月22日周三
7月16日周四
  1. Hugging Face Blog22

    新模型更强,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别低约 13 分和 16 分。该模型经葡萄牙语监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,以换取领域内更高的提取质量与更低的退化率。

  2. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动入侵

    Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,攻击由自主 AI 智能体系统端到端驱动,通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,随后横向移动至多个内部集群。

    推荐理由:Hugging Face 首次披露由自主 AI 智能体全程驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。

7月15日周三
  1. Hugging Face Blog58

    Hume 发布 Real World VoiceEQ 语音 AI 人类质量评测基准

    Hume 发布 Real World VoiceEQ 基准,用于评估语音 AI 的人类交互质量,覆盖 40 多个专有与开源语音模型、15 个以上评估维度和 60 多项指标。该基准基于超 100 万条人类评分构建,包含 785,000 条 TTS 评分和 48,000 条 STS 评分。评测发现语音模型在说话上优于倾听,部分系统仍以文本转录为主,忽略语调、停顿和情感等副语言线索。

7月10日周五
7月9日周四
  1. Google Research60

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从可穿戴数据直接学习的大规模传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者、覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的可穿戴数据预训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。

7月8日周三
  1. Google Research62

    Google Research 在 10 座美国城市实验导航协同分流缓解拥堵

    Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。

    推荐理由:Google Research 在 10 座美国城市做了为期半月的真实路网实验,读者可了解协同导航对全城车速与排放的实际影响。

7月7日周二
  1. Berkeley AI Research36

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出,近乎免费的推理成本带来三类数据系统挑战:面向智能体的数据系统、由智能体运行的数据系统,以及由智能体构建的数据系统。

  2. Hugging Face Blog78

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与部署 CLI

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的新能力边界。

7月6日周一
7月1日周三
6月30日周二
  1. Google Research67

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统树模型流程。

6月25日周四
  1. Google Research31

    Google Research 研究:推理如何解锁 LLM 的参数化知识

    Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法触及的参数化知识,即使面对简单单跳事实问题。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:计算缓冲效应(用无意义文本填充推理长度也能提升召回)和事实启动(生成相关事实为正确答案做语义预热)。

6月17日周三
  1. Google Research22

    Google Earth AI 发布矢量化数据集,将英国树篱与石墙转为可行动生态清单

    Google Research 发布矢量化数据集,把此前 Farmscapes 2020 的栅格地图转为树篱、石墙和矮林的可用生态清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征低于 0.5)区分林地、树丛与树篱。

6月11日周四