跳到正文
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时的二元问答任务,用户用自然语言写出策略,模型输出校准后的安全分数,无需重新训练即可适配新策略,文本安全表现可匹配最高 7 倍参数量的开放 guard 模型。模型可在单张 16GB NVIDIA GPU 上运行,统一处理文本、图像及文本加图像内容。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定危害分类,读者可据此判断内容审核的部署方式变化。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,理解物理世界、规划多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断具身推理模型的当前水位。

7月28日周二
7月23日周四
7月21日周二
7月16日周四
  1. Hugging Face Blog22

    新模型更强,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别低约 13 分和 16 分。该模型经葡萄牙语监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,以换取领域内更高的提取质量与更低的退化率。

7月15日周三
  1. Hugging Face Blog88

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,这是一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,同时推出 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生支持图像音频文本输入,读者可据此了解开源多模态大模型的部署门槛与推理引擎支持情况。

7月3日周五
7月1日周三
  1. Berkeley AI Research12

    Berkeley BAIR 实验室 2026 届博士毕业生展示

    Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。

  2. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 推理。该架构采用模块化设计,依次由 NVIDIA Parakeet 做语音识别、Gemma 4 VLM 在 Cerebras 上推理、阿里 Qwen3TTS 做文本转语音,各层均可替换。

    推荐理由:原文给出可复用的开源语音到语音架构与各层组件,读者可据此评估实时语音交互的搭建方式。

6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。

    推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。

6月13日周六
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。

6月5日周五
5月29日周五
  1. Google Research62

    Google Research 在 I/O 2026 公布 Gemini for Science、Antigravity 2.0 等进展

    Google Research 在 I/O 2026 上公布多项进展,包括面向科研的 Gemini for Science 工具套件、智能体开发平台 Antigravity 2.0,以及量子计算与健康 AI 方向的新成果。

    推荐理由:Google Research 在 I/O 2026 集中披露 Gemini for Science、Antigravity 2.0 与量子计算等进展,可一览其研究到产品的转化路径。

5月18日周一
5月17日周日
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。

5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。

    推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。

4月30日周四
4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。

4月9日周四
3月24日周二
  1. Mistral AI71

    Mistral 发布 Voxtral TTS 语音模型,4B 参数支持 9 种语言

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

    推荐理由:Mistral 首款 TTS 模型给出参数规模、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断语音智能体的成本与选型。

3月18日周三
3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一开源模型,读者可据此判断小模型统一化的取舍。

3月12日周四
  1. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署 AMIE 做就诊前问诊,读者可了解其安全监督机制与诊断表现。

12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3 文档解析模型

    Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。

    推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。

12月3日周三
8月1日周五
7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,含 24B 与 3B 两个版本

    Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备多语言、音频问答与摘要、语音触发函数调用等能力,API 定价每分钟 0.001 美元起。

    推荐理由:Mistral 开源语音理解模型 Voxtral,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。

5月7日周三
3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。

3月7日周五
  1. Mistral AI78

    Mistral AI 发布文档理解模型 Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并支持表格、公式和 LaTeX 等复杂版式。

    推荐理由:官方给出 Mistral OCR 的基准对比、定价与自托管选项,可据此判断文档解析在 RAG 流程中的位置。