NVIDIA 如何用 DSX 平台把 AI 工厂从兆瓦变成 Token
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信操作以同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高交互、高能效推理。文章指出,AI 工厂的核心约束是功耗,因此每瓦性能而非原始吞吐量才是衡量 AI 平台价值的最终标准。Vera Rubin 平台正是围绕这一目标设计。
IEEE Spectrum 文章指出,2026 年 AI 焦点已从训练转向推理,推理模型与智能体让推理负载大幅上升。文章解释推理的 prefill 与 decode 两阶段差异,指出 H100 运行开源 LLM 时有 50% 至 80% 时间处于空闲,内存带宽成为瓶颈。
NVIDIA 通过全栈 NIM 优化,让 Nemotron 3 Ultra 在相同 GPU 基础设施上可服务的并发用户数提升 2.5 倍,同时保持应用交互响应。该优化针对智能体 AI 负载中提示词长、上下文跨步骤复用等特点,在生产部署中平衡并发量与交互性。
NVIDIA 发布 CUDA Toolkit 13.4,新增 Windows on Arm 平台支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 提供支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
三星电子宣布与 Mistral AI 达成战略合作,将在半导体业务中引入 Mistral 的 AI 服务与解决方案,包括旗舰大语言模型 Mistral Large,用于开发面向智能化基础设施的定制本地部署 AI 模型。
三星电子与 ASML 宣布扩大长期战略合作,深化 High NA EUV 光刻与先进半导体制造技术协作。三星将加入推动下一代 12 英寸光罩技术的行业计划,取代沿用数十年的 6 英寸光罩格式,以提升晶圆厂产能、降低芯片制造成本并消除拼接限制。三星还计划在 2028 年前首次将 ASML 的 High NA EUV 引入 DRAM 大规模量产。
推荐理由:三星与 ASML 扩大 High NA EUV 合作并推动 12 英寸光罩,可了解先进制程与 DRAM 制造路线的下一步。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力容量、基础设施和商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司最大股权融资,读者可了解其主权 AI 全栈定位与投资方阵容。
NVIDIA 宣布推出 CUDA Rust,为 Rust 提供两条编写 GPU 内核的路径,并计划将其持续发展和成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,CUDA Rust 面向推理引擎、服务基础设施、驱动和智能体运行时等频繁变化的 AI 系统层。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
三星将在 8 月 26-30 日于德国科隆举办的 Gamescom 2026 上,以 1,090 平方米展区展示覆盖 PC、主机与手游的游戏生态,并首发 2027 Odyssey 游戏显示器全系与新款便携 SSD。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络成为首要性能瓶颈。NVIDIA 指出,传统商用 Ethernet 虽长期主导企业与云网络,但已难以支撑这一规模。Spectrum-X Ethernet 被定位为针对 Giga-Scale AI 的网络方案。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 量增长约四倍,反映 AI 智能体推理已从单轮交互扩展为多步工作流。
NVIDIA 介绍 Groq 3 LPX,这是面向 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器。平台核心是 NVIDIA Vera Rubin NVL72,覆盖从小模型到大模型、开源与闭源在内的广泛 AI 工作负载,兼顾高吞吐与交互性;Groq 3 LPX 与 Vera Rubin NVL72 搭配可扩展该平台的能力。
推荐理由:原文说明 Groq 3 LPX 与 Vera Rubin NVL72 的搭配方式,读者可了解长上下文交互推理的硬件组合思路。
NVIDIA BlueField-4 面向智能体 AI 工厂提供新型 Scale-In 网络基础设施,用于支撑每服务器多太比特带宽下的线速网络、存储与安全处理。传统云基础设施面向可预测的通用工作负载和标准接口设计,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算,因此专用 DPU 处理成为必需。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分功耗,并非每兆瓦都能转化为产生收入的算力。
NVIDIA 指出,智能体 AI 负载高度不可预测且波动大,与传统计算稳定的运行时特征不同。在 AI 工厂中,GPU 负责运行模型,CPU 则承担编排、工具执行与沙箱计算,集群经济性取决于整栈将电力与资本转化为已完成智能体任务的效率。
三星电子宣布投资约 2400 亿韩元(1.58 亿美元),在韩国光州建设 21500 平方米的 FläktGroup HVAC 生产线,计划 2028 年完工投产,生产面向 AI 数据中心的高级冷却解决方案等产品。该产线将成为 FläktGroup 全球第 15 个制造基地,配合其印度 Pune 新工厂,助力三星全面拓展韩国 HVAC 市场。
Hugging Face 博客介绍其自研的约束感知 GPU 分配器,在相同硬件与负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,闲置即持续亏损。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让 GPU 保持忙碌。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业平台的一部分。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其能力边界与工业落地场景。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备制造商 ASML 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可了解其估值与半导体产业链合作方向。
MathWorks 的 MATLAB 平台高级产品经理 Heather Gorr 阐述了 AI 在芯片设计与制造全流程中的作用,包括缺陷检测、异常检测与故障缓解、计划与非计划停机分析。她指出,用代理模型替代计算密集的物理建模可加速参数扫描与 Monte Carlo 仿真,从而降低成本,但这类 AI 模型精度不及物理模型,且建模依赖来自多种传感器和团队的数据。