Mistral AI 如何排查 vLLM 中的内存泄漏
Mistral AI 在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1 的 Prefill/Decode 分离部署中,开启 graph compilation 后系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Mistral AI 在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1 的 Prefill/Decode 分离部署中,开启 graph compilation 后系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测解码器性能。该方法用已知噪声物理直接计算 H(Y|X),仅需学习 H(Y),优化后的设计在更少内存和算力、无需任务专用解码器的情况下达到与端到端方法相当的水平。
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。
Mistral AI 发布 Devstral 2 编码模型家族,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:Mistral 开源编码模型与配套 CLI 同时发布,可对照其参数规模、SWE-bench 成绩与部署门槛判断实用性。
Mistral 发布 Mistral 3 系列,包括 Mistral Large 3 与 3B、8B、14B 三个尺寸的 Ministral 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源,并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。
Mistral AI 宣布与 SAP 建立多年期合作,为其 AI Foundation 集成模型并共同开发面向欧洲复杂行业与公共管理的行业解决方案,同时与 Helsing 加速面向国防与安全应用的视觉-语言-动作模型研发。Mistral AI 还将在未来数月内在德国开设办公室,并大幅扩充本地团队。
一篇新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。
Mistral 发布 AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把内部大规模系统的可观测、执行与治理能力打包成企业平台,可据此判断生产级 AI 工作流的落地路径。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备制造商 ASML 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可了解其估值与半导体产业链合作方向。
Mistral 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并始终显示来源链接的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与从其他平台导入。同步上线的 Memory Insights 会基于用户自身数据提示记忆趋势与摘要,后续将支持记忆分类、即时遗忘和更清晰的调用记录。
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并允许接入任意远程 MCP 服务器或自定义连接器。
推荐理由:原文列出 20 多个 MCP 连接器的覆盖范围与部署方式,可据此判断企业工具接入 AI 助手的具体路径。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
Mistral 通过 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)的 8000 训练样本与 2000 测试样本上显著优于未微调基线。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比前代接受补全量提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:原文给出 Codestral 25.08 的补全提升数据与 Devstral 在 SWE-Bench Verified 上的成绩,可据此判断企业自部署编码方案的能力边界。
Mistral AI 与 Carbone 4、ADEME 合作完成首个 AI 模型全生命周期分析,并披露 Mistral Large 2 截至 2025 年 1 月的环境影响:训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281000 m³ 水和 660 kg Sb eq。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备多语言、音频问答与摘要、语音触发函数调用等能力,API 定价每分钟 0.001 美元起。
推荐理由:Mistral 开源语音理解模型 Voxtral,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数、开源许可与 API 定价,便于对比选型。
Mistral AI 推出 AI for Citizens 合作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新并保障竞争力。该计划已在法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国落地,提供开放模型、自托管部署、数据主权保障及定制化研发,以替代封闭供应商的“一刀切”方案。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成栈,涵盖 GPU、编排、API 与产品服务。该服务将提供 NVIDIA 参考架构,可用 GPU 达数万块,并计划在未来数年快速扩张。Mistral 称其面向希望摆脱美国或中国云厂商依赖的欧洲、中东、亚洲及南半球国家与企业,强调数据主权与脱碳能源。
推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲主权算力供给的另一种路径。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时开源与商用,读者可据此了解其多语言推理定位与 Le Chat 的加速方案。
Mistral 发布 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 部署,代码保留在企业边界内。
推荐理由:Mistral 把编码模型、IDE 插件和企业管控打包成可本地部署的方案,读者可据此判断企业级编码助手的落地路径。
Mistral AI 发布 Codestral Embed,这是其首个专为代码打造的嵌入模型,在真实代码检索任务上表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
Mistral AI 与 All Hands AI 合作发布编码智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 模型 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上超过此前开源模型,并给出本地部署与 API 定价,可据此判断开源编码智能体的可用性。
Mistral 发布企业版 AI 助手 Le Chat Enterprise,由全新的 Mistral Medium 3 模型驱动,提供企业搜索、Agent 构建、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进一个平台,可据此判断其企业 AI 落地路径。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 0.4 美元、输出 2 美元,比 DeepSeek v3 更低。
推荐理由:Mistral Medium 3 以约八分之一成本对标 Claude Sonnet 3.7,并支持四卡以上自托管,读者可据此判断企业部署的性价比空间。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集取平均得到加权总分。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。
推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并支持表格、公式和 LaTeX 等复杂版式。
推荐理由:官方给出 Mistral OCR 的基准对比、定价与自托管选项,可据此判断文档解析在 RAG 流程中的位置。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中建单。
Andrew Ng 在 IEEE Spectrum 专访中提出,AI 的下一个重要转向是"以数据为中心",用"小数据"方案解决模型效率、准确率和偏见问题。他认为大模型扩展仍适用于 NLP 和视频等场景,但许多行业并不存在海量数据集,50 个精心设计的样本就可能足够训练神经网络。他目前通过 Landing AI 的 LandingLens 平台,用计算机视觉帮助制造业改进视觉检测。
MathWorks 的 MATLAB 平台高级产品经理 Heather Gorr 阐述了 AI 在芯片设计与制造全流程中的作用,包括缺陷检测、异常检测与故障缓解、计划与非计划停机分析。她指出,用代理模型替代计算密集的物理建模可加速参数扫描与 Monte Carlo 仿真,从而降低成本,但这类 AI 模型精度不及物理模型,且建模依赖来自多种传感器和团队的数据。
MIT 研究人员利用二维绝缘体六方氮化硼(hBN)替代传统共面电容结构,将可集成到器件上的超导量子比特数量提升 100 倍,同时降低相邻量子比特间的串扰。该电容以 hBN 为绝缘层、二硒化铌为超导电极,约 90% 电场被约束在夹层结构内,使电容尺寸大幅缩小。团队下一步的挑战是 hBN 与二维超导体的晶圆级生长与堆叠。