Apple Mac Studio(M5 Ultra)评测:本地跑前沿级大模型
WIRED 评测 Apple Mac Studio(M5 Ultra),该配置最高 256GB 统一内存、80 核 GPU,内存带宽 1.2TB/s,可在本地离线运行 122B 参数的 Qwen 3.5 并完成智能体任务。
WIRED 评测 Apple Mac Studio(M5 Ultra),该配置最高 256GB 统一内存、80 核 GPU,内存带宽 1.2TB/s,可在本地离线运行 122B 参数的 Qwen 3.5 并完成智能体任务。
技嘉发布 AI TOP 100 B850 台式整机,支持 1 张 NVIDIA GeForce RTX 5090 或 2 张 AMD Radeon AI PRO R9700 显卡。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
Google 发布新前沿模型 Gemini 4 Argon,先向 Fairwind 计划的“可信网络防御者”和内部团队开放,随后再面向开发者、企业和消费者,尚未给出具体日期。
推荐理由:梳理了 Gemini 4 Argon 的定价、上下文与多项独立评测表现,可据此判断它在前沿模型中的位置。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统。生成式推荐把推荐重构为用户行为序列建模,用户的交互、上下文、候选物品与动作都成为高基数事件流中的 token,而非孤立的召回、排序、预测阶段。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
Google 发布新前沿模型 Gemini 4 Argon,面向复杂长程工作流的深度推理,输出 token 上限从 64K 提升到 1M,并扩展了编码、推理和多模态能力。
推荐理由:Google 新前沿模型把输出上限提到 1M token,并给出编码、安全与内部落地数据,可据此判断长程推理的实用边界。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol 模型以及 Decisions API、Agents API、ChatGPT Spaces 与 Marketplace 等平台更新,ChatGPT 周活跃用户达 12 亿。
推荐理由:OpenAI DevDay 2026 一次性放出 Dots 智能体、GPT-6.1 Sol 与多项平台更新,可据此了解其产品线与定价变化。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了同日发布的四款新模型,并给出完整价格对比表,可据此判断这轮降价对应用成本的影响。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,以集合级属性奖励评估整组结果,避免推理时生成数百个 CoT 推理 token。相关论文已被 ICML 2026 收录。
METR 研究显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍,而 AI 研究本身的算法进展尚无显著加速。
NVIDIA 宣布其 AVO 在 ARC-AGI-3 上达到 100%,称其展示了面向长时程自主智能体的前沿级通用架构。文章指出前沿语言模型只是 AI 智能体的一部分,外围的 harness 决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中保持进展。
推荐理由:NVIDIA 公布 AVO 在 ARC-AGI-3 上的成绩,读者可了解其面向长时程自主智能体的架构思路。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,Opus 5 和 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远低于人类的 100%。
微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。
微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。