Mistral 发布 OCR 3 文档解析模型
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。
Mistral 发布 Mistral 3 系列,包括 Mistral Large 3 与 3B、8B、14B 三个尺寸的 Ministral 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源,并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备多语言、音频问答与摘要、语音触发函数调用等能力,API 定价每分钟 0.001 美元起。
推荐理由:Mistral 开源语音理解模型 Voxtral,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 0.4 美元、输出 2 美元,比 DeepSeek v3 更低。
推荐理由:Mistral Medium 3 以约八分之一成本对标 Claude Sonnet 3.7,并支持四卡以上自托管,读者可据此判断企业部署的性价比空间。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。
推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并支持表格、公式和 LaTeX 等复杂版式。
推荐理由:官方给出 Mistral OCR 的基准对比、定价与自托管选项,可据此判断文档解析在 RAG 流程中的位置。