5500颗光引擎如何撑起4096卡超节点?华为NPO的故事还没讲完
华为自研光引擎 Hi-ONE 将以 NPO 形式进入下一代超节点,在昇腾 960 超节点中用 5500 颗替代 4.8 万颗 800G 可插拔光模块,跨柜灵衢互联设备支持 176 个 1.6T 端口,单机全光互联带宽约 280T。
华为自研光引擎 Hi-ONE 将以 NPO 形式进入下一代超节点,在昇腾 960 超节点中用 5500 颗替代 4.8 万颗 800G 可插拔光模块,跨柜灵衢互联设备支持 176 个 1.6T 端口,单机全光互联带宽约 280T。
日本电力公司 JERA 与戴尔、主权 AI 基础设施开发商 RHAELM 签署谅解备忘录,将共同制定日本 AI 基础设施建设标准化框架。首个数据中心落地千叶县,设计容量 400MW,总投资预计超过 150 亿美元,Apollo 提供投融资支持。
AMD 公布 EPYC 9006(代号 Venice)全系规格与定价,覆盖 8 到 256 核,价格从 700 美元到 14904 美元。旗舰 256 核 EPYC 9996 售价 14904 美元,每核约 58.21 美元,而 64 核 EPYC 9556 每核约 125.12 美元。
Linux 内核 7.4 将合入名为 PerfOpt 的补丁,允许 AMD 集成 GPU 绕过 IOMMU 直接访问系统内存,从而降低系统开销。据 Phoronix 测试,AMD Strix Halo APU 上的本地 LLM 性能最高可提升 18-23%。该补丁对 Valve Steam Deck 等低功耗 AMD 掌机尤为重要,CachyOS 等发行版可能更早获得支持。
TrendForce 最新存储产业研究显示,4Q26 常规 DRAM 合约价预计环比上涨 10-15%,NAND Flash 整体合约价预计环比上涨 15-20%,AI 服务器需求是主要支撑。
据《金融时报》报道,腾讯已与甲骨文签署其最大海外租赁协议,在东南亚多个甲骨文数据中心获取约 10 万块先进 AI 芯片,交易估值约 70 亿美元,首付约 30%,腾讯和甲骨文均未回应置评请求。
面向数据中心设备的开源硅信任根架构 Caliptra 正获得多家云与半导体公司支持,云和数据中心运营商开始要求芯片供应商提供符合 Caliptra 商标要求的实现,供应商须通过对照集成清单的一致性评估。选定该架构只是起点,商业部署还需解决跨 SoC 信任扩展、密钥服务接口、安全启动协同、认证目标与生命周期管理等工程问题,信任根也正从孤立安全锚点演变为平台级安全编排者。
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,成为较早交付该平台的云厂商之一,Cognition 是首个在 Vera Rubin 上跑生产负载的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力走向。
AI 算力需求推动先进封装走向尺寸更大与互连间距更小,KLA、ASM、ASMPT 与新加坡国立大学专家在 A*STAR Innovate Together 2026 上指出,混合键合、HBM 集成与光互连正把材料、键合、量测与检测整合为系统级难题。
Astera Labs 推出 Leo X-Series fabric-attached 内存控制器及新一代 Leo 2 E-Series、P-Series,针对 LLM 向多轮智能体系统演进时的内存性能优化。
新加坡半导体工业协会执行董事 Ang Wee Seng 在 EE Power Asia 2026 上表示,AI 已把计算从数字挑战变成物理基础设施竞赛,瓶颈不再是芯片设计,而是能否供电、连接、散热和快速部署。
OpenAI 硬件负责人 Richard Ho 表示,自研推理 ASIC Jalapeño 目前面向 OpenAI 内部算力需求,公司内部需求增长很快,短期内会优先满足自身,但芯片本身并非只能用于 OpenAI 模型。
OpenAI 硬件副总裁 Richard Ho 在采访中详解了 Jalapeño 推理 ASIC 的设计过程,该芯片在 Hot Chips 2026 上发布,从零开始到流片约九个月,主要借助 Codex 等 AI 模型辅助设计。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,让客户在正常运行时不必为 GPU 峰值功耗预留保护性缓冲。AI 工厂通常按所有 GPU 同时达到峰值功耗的极端情况配置电力,导致大量基础设施在平时处于闲置状态。
AWS 在 Amazon EKS 上结合 EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、PPO 和 GRPO 等大规模训练流程。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄将流量导向更慢路径。这类问题往往要到训练运行数小时后才被发现。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,为 LLM 推理提供可信执行环境。该方案面向个人、企业和受监管场景中处理敏感信息与专有模型上下文的推理负载,支持私有高性能生产级 AI 推理。
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度,解决放置不当导致拓扑域碎片化、流量被迫走共享链路的问题。该方案针对功耗受限的 AI 工厂,可避免吞吐下降与作业成本上升,并减少 GPU 空耗电力等待数据的情况。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 在埃及大埃及博物馆举办活动,展示当地 AI 生态从能力建设走向生产规模,其 Deep Learning Institute 埃及学员基数一年增长超十倍。
NVIDIA 发布 Halos 全栈安全系统,覆盖物理 AI 从硬件、软件到 AI 行为与部署验证的每一层,用于自动驾驶与机器人。ABI Research 预计 2035 年 L3-5 自动驾驶汽车保有量达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信操作以同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高交互、高能效推理。文章指出,AI 工厂的核心约束是功耗,因此每瓦性能而非原始吞吐量才是衡量 AI 平台价值的最终标准。Vera Rubin 平台正是围绕这一目标设计。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络成为首要性能瓶颈。NVIDIA 指出,传统商用 Ethernet 虽长期主导企业与云网络,但已难以支撑这一规模。Spectrum-X Ethernet 被定位为针对 Giga-Scale AI 的网络方案。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 量增长约四倍,反映 AI 智能体推理已从单轮交互扩展为多步工作流。
NVIDIA 介绍 Groq 3 LPX,这是面向 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器。平台核心是 NVIDIA Vera Rubin NVL72,覆盖从小模型到大模型、开源与闭源在内的广泛 AI 工作负载,兼顾高吞吐与交互性;Groq 3 LPX 与 Vera Rubin NVL72 搭配可扩展该平台的能力。
推荐理由:原文说明 Groq 3 LPX 与 Vera Rubin NVL72 的搭配方式,读者可了解长上下文交互推理的硬件组合思路。
NVIDIA BlueField-4 面向智能体 AI 工厂提供新型 Scale-In 网络基础设施,用于支撑每服务器多太比特带宽下的线速网络、存储与安全处理。传统云基础设施面向可预测的通用工作负载和标准接口设计,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算,因此专用 DPU 处理成为必需。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分功耗,并非每兆瓦都能转化为产生收入的算力。
NVIDIA 指出,智能体 AI 负载高度不可预测且波动大,与传统计算稳定的运行时特征不同。在 AI 工厂中,GPU 负责运行模型,CPU 则承担编排、工具执行与沙箱计算,集群经济性取决于整栈将电力与资本转化为已完成智能体任务的效率。