Apple Mac Studio(M5 Ultra)评测:本地跑前沿级大模型
WIRED 评测 Apple Mac Studio(M5 Ultra),该配置最高 256GB 统一内存、80 核 GPU,内存带宽 1.2TB/s,可在本地离线运行 122B 参数的 Qwen 3.5 并完成智能体任务。
WIRED 评测 Apple Mac Studio(M5 Ultra),该配置最高 256GB 统一内存、80 核 GPU,内存带宽 1.2TB/s,可在本地离线运行 122B 参数的 Qwen 3.5 并完成智能体任务。
Google 发布新前沿模型 Gemini 4 Argon,先向 Fairwind 计划的“可信网络防御者”和内部团队开放,随后再面向开发者、企业和消费者,尚未给出具体日期。
推荐理由:梳理了 Gemini 4 Argon 的定价、上下文与多项独立评测表现,可据此判断它在前沿模型中的位置。
丰田在英国 Bentwaters 机场用起重机将 1,675 磅(760 kg)房车吊至 30 英尺高空,直接砸向电动 Hilux 车顶,车辆除车身几处损伤外随即启动驶离。
雷峰网在 Claude Code 中用同一任务实测同日发布的 Qwen3.8-Flash 与 GLM-5.3-Flash,要求从零开发一个含任务、日程、笔记、Dashboard 和全局搜索的个人工作台。
雷峰网在同一台服务器上用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两者总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
Beats 360 是一款售价 350 美元的无线头戴耳机,主打可拆卸耳罩与头梁的配色混搭,并支持 Apple 设备即时配对、Find My、Siri 以及 Android 快速配对。
作者对 ColorOS 17 进行了约一个月的深度体验,重点评测焕新凝光视效、流体动效、小布 AI 与小布 Next 等更新。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者用同一提示词实测 Sonnet 5.5 的免费层表现,并给出与 Opus 5.5 的对比和成本数据。
基于开源 Switch 模拟器 Eden 的 ProsperoEden 项目已可在破解版 PS5 上运行 Nintendo Switch 游戏,目前处于早期 alpha 阶段并免费发布于 GitHub。
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测结果,覆盖 HealthBench。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,Opus 5 和 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远低于人类的 100%。
微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。