OpenAI 发布 ChatGPT Images 2.5
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的定位,读者可了解它在个性化图像生成上的能力方向。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的定位,读者可了解它在个性化图像生成上的能力方向。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,可直接学习实时卫星观测数据,每小时生成一次预报。
推荐理由:WeatherNext 3 用实时卫星数据替代 NWP 训练源,读者可据此理解 AI 天气预报在分辨率与更新频率上的路线变化。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。
阿里发布 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览,供开发者实验和评估。该模型是多模态 MoE 模型,主模型 125B 参数,另有 51B N-gram 嵌入向量,每 token 激活 6B 参数,原生上下文窗口 262,144 token,可扩展至 1M token。NVIDIA 开发者博客介绍了在 GB300 NVL72 上针对智能体编码的实验。
推荐理由:阿里开放 Qwen3.8-Flash-Next 权重供开发者试用,可据此了解 Qwen4 架构预览版的 MoE 规格与长上下文能力。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
NVIDIA 宣布其 AVO 在 ARC-AGI-3 上达到 100%,称其展示了面向长时程自主智能体的前沿级通用架构。文章指出前沿语言模型只是 AI 智能体的一部分,外围的 harness 决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中保持进展。
推荐理由:NVIDIA 公布 AVO 在 ARC-AGI-3 上的成绩,读者可了解其面向长时程自主智能体的架构思路。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和智能体最强的主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:Gemini 3.7 Flash 在编码与智能体任务上的基准提升和半价定价,可供开发者评估迁移成本。
Google DeepMind 发布多语种手语转文本模型 SL2T,在 Pixel 11 的 Gboard 和 Live Transcribe 中提供手语听写功能,首发支持美国手语(ASL)转英文,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译模型落到 Gboard 与 Live Transcribe,读者可了解其数据规模、隐私设计与基准表现。
Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:WeatherNext 在气旋路径与强度预测上多出约一天预警时间,并开源模型权重,读者可据此判断 AI 天气预报的可用边界。
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,理解物理世界、规划多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断具身推理模型的当前水位。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、高级灵巧操作和多机器人协作。
推荐理由:Google DeepMind 发布 Gemini Robotics 2 系列模型,读者可了解机器人在全身控制、灵巧操作与多机协作上的能力边界。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:原文给出 Gemini 3.5 Flash Cyber 的基准表现与限量开放方式,读者可据此判断轻量安全模型的落地路径。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可了解其能力边界与配套安全机制。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布 Gemini 3.5 Live Translate,读者可了解其连续语音翻译机制与在 Google 产品中的落地节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首批上线渠道。