Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家和生物安全专家用 AI 应对疫情。
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家和生物安全专家用 AI 应对疫情。
Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,攻击由自主 AI 智能体系统端到端驱动,通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,随后横向移动至多个内部集群。
推荐理由:Hugging Face 首次披露由自主 AI 智能体全程驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中证明,扩散模型的创造力并非随机偶然,而是神经网络训练中权重衰减等正则化带来的"分数平滑"所致。
Hugging Face 在 AppWorld Test Challenge 上用同一 CodeAct 智能体跑 417 个任务发现,Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),原因是缓存读取定价而非标价。
Hume 发布 Real World VoiceEQ 基准,用于评估语音 AI 的人类交互质量,覆盖 40 多个专有与开源语音模型、15 个以上评估维度和 60 多项指标。该基准基于超 100 万条人类评分构建,包含 785,000 条 TTS 评分和 48,000 条 STS 评分。评测发现语音模型在说话上优于倾听,部分系统仍以文本转录为主,忽略语调、停顿和情感等副语言线索。
Thinking Machines 在 Hugging Face 发布 Inkling,这是一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,同时推出 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生支持图像音频文本输入,读者可据此了解开源多模态大模型的部署门槛与推理引擎支持情况。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,初期覆盖 8 种语言,底层采用 Gemini 3.5 Flash 模型。首批试点覆盖印度 100 所学校。
Hugging Face 博客发布 "Profiling in PyTorch" 系列第三部分,用 NVIDIA A100-SXM4-80GB 剖析注意力机制的 profiler 轨迹。文章对比朴素注意力、原地操作(masked_fill_)和 SDPA 等实现,发现将 masked_fill 改为原地操作可消除一次 Memcpy kernel,在多层 Transformer 中逐层累积节省。
Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本化、归属和可追溯的集中记录。每个版本不可篡改,支持回滚、对比、分类标签和审计日志,资产可通过 MCP server 直接在生产环境执行。该功能面向 Mistral Studio 客户开放,数据保留在企业边界内。
Google Research 发布 SensorFM,一个从可穿戴数据直接学习的大规模传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者、覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的可穿戴数据预训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、不依赖 LiDAR 或深度传感器,在 R2R-CE validation unseen 上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:Mistral 首款具身导航模型只用单目 RGB 相机就在 R2R-CE 上超过多传感器方案,可看其训练与强化学习设计。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到或超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超越原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体架构与并行配置,读者可据此判断迁移成本。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并自动预加载模型、秒级创建预配置权限的新域。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。
推荐理由:Google Research 在 10 座美国城市做了为期半月的真实路网实验,读者可了解协同导航对全城车速与排放的实际影响。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,提供每周刷新的开源权重模型目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出模型目录、运行时与一键部署路径,读者可据此判断开源模型在企业侧的上手成本。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出,近乎免费的推理成本带来三类数据系统挑战:面向智能体的数据系统、由智能体运行的数据系统,以及由智能体构建的数据系统。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的新能力边界。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多家云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出跨云挂载 Hub 数据的具体配置与实测吞吐,读者可据此判断能否省下跨云读取成本。
Hugging Face 发布 PRX 系列第四篇,详解其 7B 模型的数据策略:预训练数据由公开与内部数据集混合而成,并用 VLM 重新生成图像长描述。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多花约 1 天)。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载可信发布者的内核,其他来源需显式传入 trust_remote_code=True。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,双方将围绕多个项目展开深度研发协作,让 A24 的创作者参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦于打通前沿技术与下一代娱乐之间的鸿沟,具体目标与技术产出将随时间演进。
Mistral AI 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34%。
推荐理由:原文给出 Leanstral 1.5 的基准成绩、训练流程与开源入口,读者可据此判断形式化验证模型的当前水位与成本差异。
Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 推理。该架构采用模块化设计,依次由 NVIDIA Parakeet 做语音识别、Gemma 4 VLM 在 Cerebras 上推理、阿里 Qwen3TTS 做文本转语音,各层均可替换。
推荐理由:原文给出可复用的开源语音到语音架构与各层组件,读者可据此评估实时语音交互的搭建方式。
Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1331 个专家测试。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 分辨率 Airbus Pléiades Neo 影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在有限资源下,专业化而非通用化才是取得性能优势的路径。Wolpert 与 Macready 1997 年证明没有单一通用优化算法能在所有问题上胜过其他算法,通用性并非性能优势。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统树模型流程。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可交叉发布并回链到完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。
Google Research 发布新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 上,在 Pixel 9 和 10 系列上实现开箱即用的推理加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,给出端侧推理提速与省内存的具体做法,可看移动端部署思路。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增 5.5%、TCO 降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并已在公开缓存 trace 上验证。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法触及的参数化知识,即使面对简单单跳事实问题。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:计算缓冲效应(用无意义文本填充推理长度也能提升召回)和事实启动(生成相关事实为正确答案做语义预热)。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可了解其能力边界与配套安全机制。
Mistral 为 Connectors 推出多项新能力:管理员控制、带连接器作用域的 API key、多账号连接器和 Vibe Code 中的 Connectors 已 GA,Connectors Debugger 与 Workflows 中的 Connectors 处于 Public Preview。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。
推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。
Google DeepMind 宣布与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,共同开发一款 AI 规划原型工具,目标是帮助规划官员将住宅规划申请的决定时间缩短 50%。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 的栅格地图转为树篱、石墙和矮林的可用生态清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征低于 0.5)区分林地、树丛与树篱。
Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。
推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。
Google Research 公布两项关于 AI 辅助皮肤问题理解的研究,其中发表于 JAMA Dermatology 的论文让 2,345 名参与者分别使用标准搜索、AI 工具和"Wizard of Oz"工具,AI 组尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,约为对照组 8% 的近三倍。