Mistral Studio 为 Prompts 和 Skills 提供版本化管理系统
Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本化、归属和可追溯的集中记录。每个版本不可篡改,支持回滚、对比、分类标签和审计日志,资产可通过 MCP server 直接在生产环境执行。该功能面向 Mistral Studio 客户开放,数据保留在企业边界内。
Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本化、归属和可追溯的集中记录。每个版本不可篡改,支持回滚、对比、分类标签和审计日志,资产可通过 MCP server 直接在生产环境执行。该功能面向 Mistral Studio 客户开放,数据保留在企业边界内。
Google Research 发布 SensorFM,一个从可穿戴数据直接学习的大规模传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者、覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的可穿戴数据预训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、不依赖 LiDAR 或深度传感器,在 R2R-CE validation unseen 上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:Mistral 首款具身导航模型只用单目 RGB 相机就在 R2R-CE 上超过多传感器方案,可看其训练与强化学习设计。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到或超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超越原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体架构与并行配置,读者可据此判断迁移成本。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并自动预加载模型、秒级创建预配置权限的新域。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。
推荐理由:Google Research 在 10 座美国城市做了为期半月的真实路网实验,读者可了解协同导航对全城车速与排放的实际影响。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,提供每周刷新的开源权重模型目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出模型目录、运行时与一键部署路径,读者可据此判断开源模型在企业侧的上手成本。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出,近乎免费的推理成本带来三类数据系统挑战:面向智能体的数据系统、由智能体运行的数据系统,以及由智能体构建的数据系统。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的新能力边界。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多家云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出跨云挂载 Hub 数据的具体配置与实测吞吐,读者可据此判断能否省下跨云读取成本。
Hugging Face 发布 PRX 系列第四篇,详解其 7B 模型的数据策略:预训练数据由公开与内部数据集混合而成,并用 VLM 重新生成图像长描述。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多花约 1 天)。
Import AI 第 464 期汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上写出被维护者称为首个真正且最快的 megakernel。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载可信发布者的内核,其他来源需显式传入 trust_remote_code=True。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,双方将围绕多个项目展开深度研发协作,让 A24 的创作者参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦于打通前沿技术与下一代娱乐之间的鸿沟,具体目标与技术产出将随时间演进。
Mistral AI 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34%。
推荐理由:原文给出 Leanstral 1.5 的基准成绩、训练流程与开源入口,读者可据此判断形式化验证模型的当前水位与成本差异。
Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 推理。该架构采用模块化设计,依次由 NVIDIA Parakeet 做语音识别、Gemma 4 VLM 在 Cerebras 上推理、阿里 Qwen3TTS 做文本转语音,各层均可替换。
推荐理由:原文给出可复用的开源语音到语音架构与各层组件,读者可据此评估实时语音交互的搭建方式。
Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1331 个专家测试。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 分辨率 Airbus Pléiades Neo 影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在有限资源下,专业化而非通用化才是取得性能优势的路径。Wolpert 与 Macready 1997 年证明没有单一通用优化算法能在所有问题上胜过其他算法,通用性并非性能优势。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统树模型流程。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可交叉发布并回链到完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。
NVIDIA 推出 ENPIRE 框架,让编码智能体自主驱动物理机器人完成策略迭代,在 PushT、插针、剪扎带等任务上达到 99% 成功率,硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5 在 Codex 中与 Claude Code 里的 Opus 4.7 表现互有胜负,Kimi-2.6 落后,8 个智能体并行时得分更高。
Google Research 发布新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 上,在 Pixel 9 和 10 系列上实现开箱即用的推理加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,给出端侧推理提速与省内存的具体做法,可看移动端部署思路。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增 5.5%、TCO 降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并已在公开缓存 trace 上验证。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法触及的参数化知识,即使面对简单单跳事实问题。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:计算缓冲效应(用无意义文本填充推理长度也能提升召回)和事实启动(生成相关事实为正确答案做语义预热)。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可了解其能力边界与配套安全机制。
Mistral 为 Connectors 推出多项新能力:管理员控制、带连接器作用域的 API key、多账号连接器和 Vibe Code 中的 Connectors 已 GA,Connectors Debugger 与 Workflows 中的 Connectors 处于 Public Preview。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。
推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。
牛津大学、英国AI安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、18,978场对话、6,923名参与者发现,AI系统在文本说服上稳定优于人类专家,即使专家可自选议题、提前研究并接受1000英镑奖金激励。
Google DeepMind 宣布与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,共同开发一款 AI 规划原型工具,目标是帮助规划官员将住宅规划申请的决定时间缩短 50%。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 的栅格地图转为树篱、石墙和矮林的可用生态清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征低于 0.5)区分林地、树丛与树篱。
Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。
推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,目标是两三年内扩至 40-80 名全职员工,初期拟募资 1 亿至 1.5 亿美元,理由是"对齐尚未走上正轨"。该机构将围绕可扩展监督、学习理论、启发式论证、博弈论与 personas 等方向布局差异化对齐研究。
Google Research 公布两项关于 AI 辅助皮肤问题理解的研究,其中发表于 JAMA Dermatology 的论文让 2,345 名参与者分别使用标准搜索、AI 工具和"Wizard of Oz"工具,AI 组尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,约为对照组 8% 的近三倍。
加州大学圣地亚哥分校在 Google 支持下,将用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名研究人员和学生提供低成本、低碳的云计算。手机主板约占整机隐含碳的 50%,SPEC 基准显示 25-50 台手机算力相当于一台现代服务器,20 台手机集群已能支撑 75 人以上课程的评分负载且延迟低于 AWS 默认后端。该系统预计 2026 年秋季上线。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并在 Google.org 支持下发起最高 1000 万美元的多智能体 AI 安全研究资助,面向全球研究者征集提案。