Google 发布 ERA 科研工具并开放 Computational Discovery
Google 发布基于 Gemini 的科研工具 Empirical Research Assistance(ERA),可搜索文献、编写并优化科学代码,相关成果已发表于 Nature。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可了解 AI 写科学代码在流行病预测、径流预报等领域的实际表现。
Google 发布基于 Gemini 的科研工具 Empirical Research Assistance(ERA),可搜索文献、编写并优化科学代码,相关成果已发表于 Nature。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可了解 AI 写科学代码在流行病预测、径流预报等领域的实际表现。
Google DeepMind 发布博客介绍,生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 辅助逆转细胞衰老研究。
推荐理由:Google DeepMind 官方披露 Co-Scientist 在衰老研究中的实际用法,读者可看到 AI 如何压缩文献筛选与数据分析周期。
Google DeepMind 在 Project Genie 中推出 Street View grounding 能力,用户可选取美国境内的真实地点并搭配风格,生成以真实影像为起点的可交互世界。
推荐理由:Project Genie 接入 Street View 真实影像,读者可了解世界模型如何用真实地点为智能体提供环境。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,可据此判断智能体在科研流程中的落地方式。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。
推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。
推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。
推荐理由:DeepMind 公开 AI co-clinician 研究,含 98 例初级保健查询与 140 项问诊技能盲评数据,可了解医疗 AI 当前能力边界。
Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久执行、可观测性和容错能力,把 AI 流程从概念验证推进到生产环境。
推荐理由:Mistral 把企业级 AI 编排的持久执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功与失败经验中提炼结构化推理记忆的智能体框架,配合 memory-aware test-time scaling(MaTTS)实现测试时自我进化。
Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡达成合作,推动前沿 AI 在企业规模化落地。合作方将获得 Gemini 系列等前沿模型的早期访问权限,并围绕金融、制造、零售、媒体娱乐等行业共同开发行业专属 AI 方案。目前仅 25% 的组织成功将 AI 规模化投入生产。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中与 AI 虚拟角色对话,评估高中和大学生的问题解决、协作等未来技能,现已在 Google Labs 开放英文注册。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中整体得分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,也是唯一超过 50.0 人类基线的框架。
Mistral AI 发布 Spaces CLI,一款同时面向人类开发者和 AI 智能体的命令行工具,通过 `spaces init`、`spaces dev` 等命令可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
推荐理由:Google 官方给出 Vibe Coding XR 的完整工作流与 VCXR60 初步评测,可了解自然语言生成 XR 应用的实际成功率与限制。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Mistral AI 发布 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 同时支持 dense 和 MoE 架构,并可按需支持多模态输入,模型可在企业内部基础设施中训练与治理。官方称已与 ASML、Ericsson、欧洲空间局等机构合作,并支持 Mistral Vibe 等智能体用自然语言完成微调、调参与合成数据生成。
推荐理由:Mistral 官方披露 Forge 的训练流程与架构支持,可据此判断企业自建前沿模型的门槛与路径。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试并在 CI/CD 中无人值守运行,多个实例可并行处理不同文件。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件和自定义工具,将质量分从 0.68 提升至 0.74。
Mistral 发布终端编码智能体 Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续推送无需手动更新。
推荐理由:官方给出 Vibe 2.0 的新增控制项与 Devstral 2 的计费口径,可据此判断终端编码智能体的使用成本。
Mistral AI 发布 Devstral 2 编码模型家族,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:Mistral 开源编码模型与配套 CLI 同时发布,可对照其参数规模、SWE-bench 成绩与部署门槛判断实用性。
Mistral 发布 AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把内部大规模系统的可观测、执行与治理能力打包成企业平台,可据此判断生产级 AI 工作流的落地路径。
Mistral 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并始终显示来源链接的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与从其他平台导入。同步上线的 Memory Insights 会基于用户自身数据提示记忆趋势与摘要,后续将支持记忆分类、即时遗忘和更清晰的调用记录。
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并允许接入任意远程 MCP 服务器或自定义连接器。
推荐理由:原文列出 20 多个 MCP 连接器的覆盖范围与部署方式,可据此判断企业工具接入 AI 助手的具体路径。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比前代接受补全量提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:原文给出 Codestral 25.08 的补全提升数据与 Devstral 在 SWE-Bench Verified 上的成绩,可据此判断企业自部署编码方案的能力边界。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线走向。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数、开源许可与 API 定价,便于对比选型。
Mistral 发布 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 部署,代码保留在企业边界内。
推荐理由:Mistral 把编码模型、IDE 插件和企业管控打包成可本地部署的方案,读者可据此判断企业级编码助手的落地路径。
Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
Mistral AI 与 All Hands AI 合作发布编码智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 模型 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上超过此前开源模型,并给出本地部署与 API 定价,可据此判断开源编码智能体的可用性。
Mistral 发布企业版 AI 助手 Le Chat Enterprise,由全新的 Mistral Medium 3 模型驱动,提供企业搜索、Agent 构建、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进一个平台,可据此判断其企业 AI 落地路径。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中建单。