Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:原文给出 Gemini 3.5 Flash Cyber 的基准表现与限量开放方式,读者可据此判断轻量安全模型的落地路径。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:原文给出 Gemini 3.5 Flash Cyber 的基准表现与限量开放方式,读者可据此判断轻量安全模型的落地路径。
Thinking Machines 在 Hugging Face 发布 Inkling,这是一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,同时推出 276B 总参数 12B 激活参数的 Inkling-Small。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生支持图像音频文本输入,读者可据此了解开源多模态大模型的部署门槛与推理引擎支持情况。
Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、不依赖 LiDAR 或深度传感器,在 R2R-CE validation unseen 上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:Mistral 首款具身导航模型只用单目 RGB 相机就在 R2R-CE 上超过多传感器方案,可看其训练与强化学习设计。
Mistral AI 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34%。
推荐理由:原文给出 Leanstral 1.5 的基准成绩、训练流程与开源入口,读者可据此判断形式化验证模型的当前水位与成本差异。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统树模型流程。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可了解其能力边界与配套安全机制。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。
推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布 Gemini 3.5 Live Translate,读者可了解其连续语音翻译机制与在 Google 产品中的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。
Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,可在最少四张 GPU 上自托管。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首批上线渠道。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计等复杂仪表。
推荐理由:Gemini Robotics-ER 1.6 升级了空间推理与多视角理解,并新增仪表读数能力,可了解机器人在真实场景中的自主性进展。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。
推荐理由:Mistral 首款 TTS 模型给出参数规模、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断语音智能体的成本与选型。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一开源模型,读者可据此判断小模型统一化的取舍。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并集成进 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出权重、API 与 FLTEval 评测,可据此判断形式化验证的成本变化。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。
推荐理由:Mistral 一次发布批量与实时两款语音转写模型,并给出延迟、错误率与价格对比,便于判断实时语音场景的可用性。
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元定价,可供评估文档解析方案时参考。
Mistral AI 发布 Devstral 2 编码模型家族,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:Mistral 开源编码模型与配套 CLI 同时发布,可对照其参数规模、SWE-bench 成绩与部署门槛判断实用性。
Mistral 发布 Mistral 3 系列,包括 Mistral Large 3 与 3B、8B、14B 三个尺寸的 Ministral 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源,并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比前代接受补全量提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:原文给出 Codestral 25.08 的补全提升数据与 Devstral 在 SWE-Bench Verified 上的成绩,可据此判断企业自部署编码方案的能力边界。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备多语言、音频问答与摘要、语音触发函数调用等能力,API 定价每分钟 0.001 美元起。
推荐理由:Mistral 开源语音理解模型 Voxtral,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数、开源许可与 API 定价,便于对比选型。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时开源与商用,读者可据此了解其多语言推理定位与 Le Chat 的加速方案。
Mistral AI 发布 Codestral Embed,这是其首个专为代码打造的嵌入模型,在真实代码检索任务上表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布编码智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 模型 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上超过此前开源模型,并给出本地部署与 API 定价,可据此判断开源编码智能体的可用性。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 0.4 美元、输出 2 美元,比 DeepSeek v3 更低。
推荐理由:Mistral Medium 3 以约八分之一成本对标 Claude Sonnet 3.7,并支持四卡以上自托管,读者可据此判断企业部署的性价比空间。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。
推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并支持表格、公式和 LaTeX 等复杂版式。
推荐理由:官方给出 Mistral OCR 的基准对比、定价与自托管选项,可据此判断文档解析在 RAG 流程中的位置。