跳到正文
7月17日周五
7月15日周三
  1. Hugging Face Blog88

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,这是一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,同时推出 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生支持图像音频文本输入,读者可据此了解开源多模态大模型的部署门槛与推理引擎支持情况。

7月8日周三
  1. Mistral AI69

    Mistral 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、不依赖 LiDAR 或深度传感器,在 R2R-CE validation unseen 上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:Mistral 首款具身导航模型只用单目 RGB 相机就在 R2R-CE 上超过多传感器方案,可看其训练与强化学习设计。

7月2日周四
  1. Mistral AI71

    Mistral 发布 Leanstral 1.5,形式化验证模型开源并免费开放 API

    Mistral AI 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34%。

    推荐理由:原文给出 Leanstral 1.5 的基准成绩、训练流程与开源入口,读者可据此判断形式化验证模型的当前水位与成本差异。

7月1日周三
6月30日周二
  1. Google Research67

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统树模型流程。

6月25日周四
6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。

    推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。

6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。

5月22日周五
  1. Mistral AI85

    Mistral 发布 Mistral Medium 3.5 与云端远程编码智能体

    Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,可在最少四张 GPU 上自托管。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。

5月18日周一
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。

4月13日周一
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计等复杂仪表。

    推荐理由:Gemini Robotics-ER 1.6 升级了空间推理与多视角理解,并新增仪表读数能力,可了解机器人在真实场景中的自主性进展。

3月24日周二
  1. Mistral AI71

    Mistral 发布 Voxtral TTS 语音模型,4B 参数支持 9 种语言

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

    推荐理由:Mistral 首款 TTS 模型给出参数规模、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断语音智能体的成本与选型。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一开源模型,读者可据此判断小模型统一化的取舍。

  2. Mistral AI65

    Mistral 发布开源代码智能体 Leanstral,面向 Lean 4 形式化证明

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并集成进 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出权重、API 与 FLTEval 评测,可据此判断形式化验证的成本变化。

2月5日周四
  1. Mistral AI71

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。

    推荐理由:Mistral 一次发布批量与实时两款语音转写模型,并给出延迟、错误率与价格对比,便于判断实时语音场景的可用性。

12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3 文档解析模型

    Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。

    推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。

12月9日周二
12月3日周三
7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比前代接受补全量提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。

    推荐理由:原文给出 Codestral 25.08 的补全提升数据与 Devstral 在 SWE-Bench Verified 上的成绩,可据此判断企业自部署编码方案的能力边界。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,含 24B 与 3B 两个版本

    Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备多语言、音频问答与摘要、语音触发函数调用等能力,API 定价每分钟 0.001 美元起。

    推荐理由:Mistral 开源语音理解模型 Voxtral,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。

7月11日周五
  1. Mistral AI66

    Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。

    推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数、开源许可与 API 定价,便于对比选型。

6月10日周二
5月28日周三
5月21日周三
  1. Mistral AI74

    Mistral AI 发布编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布编码智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 模型 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Devstral 在 SWE-Bench Verified 上超过此前开源模型,并给出本地部署与 API 定价,可据此判断开源编码智能体的可用性。

5月7日周三
3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。

3月7日周五
  1. Mistral AI78

    Mistral AI 发布文档理解模型 Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并支持表格、公式和 LaTeX 等复杂版式。

    推荐理由:官方给出 Mistral OCR 的基准对比、定价与自托管选项,可据此判断文档解析在 RAG 流程中的位置。