NVIDIA NVLink 6 如何为 AI 工厂提供多层弹性
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信操作以同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信操作以同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高交互、高能效推理。文章指出,AI 工厂的核心约束是功耗,因此每瓦性能而非原始吞吐量才是衡量 AI 平台价值的最终标准。Vera Rubin 平台正是围绕这一目标设计。
NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决从单服务器、少量客户端扩展到共享基础设施的运维难题。随着项目增长,GPU 需按任务需求分配、多项研究需相互隔离,且每个参与机构都要保留对自身数据的控制权。
IEEE Spectrum 文章指出,2026 年 AI 焦点已从训练转向推理,推理模型与智能体让推理负载大幅上升。文章解释推理的 prefill 与 decode 两阶段差异,指出 H100 运行开源 LLM 时有 50% 至 80% 时间处于空闲,内存带宽成为瓶颈。
NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。
NVIDIA 通过全栈 NIM 优化,让 Nemotron 3 Ultra 在相同 GPU 基础设施上可服务的并发用户数提升 2.5 倍,同时保持应用交互响应。该优化针对智能体 AI 负载中提示词长、上下文跨步骤复用等特点,在生产部署中平衡并发量与交互性。
NVIDIA BioNeMo Inference Runtime(BioIR)可在 NVIDIA GPU 上加速受支持的生物分子结构预测模型,同时保留熟悉的 PyTorch 工作流。它通过优化 kernel 并在适用场景使用 CUDA Graphs 提升模型速度,面向蛋白质组规模、需高效跑完整个工作列表的预测任务。
NVIDIA 联合 Palantir Foundry,用 Nemotron 把其供应链经验编码化,覆盖从 wafer-out 到 first token 的全流程。该周期分为两段:Time-to-rack 指硅片离开晶圆厂到组装系统抵达数据中心,Time-to-token 则涵盖此后的电力、冷却、网络与软件栈。
NVIDIA 详解 Encode-Prefill-Decode(EPD)分离技术:将视觉编码器阶段与 prefill、decode 阶段拆开,在图像密集提示、中短输出和量化 MoE 模型上收益最大。配合 NVIDIA Dynamo 使用,多模态模型服务最高可提速 5 倍。
NVIDIA 发布 CUDA Toolkit 13.4,新增 Windows on Arm 平台支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 提供支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力容量、基础设施和商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司最大股权融资,读者可了解其主权 AI 全栈定位与投资方阵容。
NVIDIA 宣布推出 CUDA Rust,为 Rust 提供两条编写 GPU 内核的路径,并计划将其持续发展和成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,CUDA Rust 面向推理引擎、服务基础设施、驱动和智能体运行时等频繁变化的 AI 系统层。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存企业工作中的消息、决策、项目和待办事项等随时间变化的上下文。该智能体无需在每次启动时重建上下文,即可直接基于已有记忆参与工作。
NVIDIA 发布指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型因体积过大只能把推理请求回传数据中心,带来网络依赖、成本上升和本地数据外泄风险,这一限制正在被打破。
NVIDIA 发文讲解如何在联邦 Kubernetes 与 AI 平台之间传递用户身份。现代 AI 平台中,用户可能从中央门户进入、打开受治理数据集、在数据所在处启动 notebook,并调用另一个集群中服务,身份在每一步都要跨越控制面与数据面边界,传统单点登录在此失效。
NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体工作流:主智能体把复杂任务拆解并分派给专用子智能体,用户也可同时运行多个智能体会话,这种广度优先方式能加快任务完成速度。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 开发者博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的五条准则。文章同时讨论了模型设计选择如何在不牺牲精度的情况下影响吞吐量与交互性。
NVIDIA 开发者博客介绍用 NVIDIA Nemotron 构建自适应智能体网络安全系统,让智能体在安全运营中协调工作并追求长周期复杂目标。现有许多实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将这些缺口转化为改进。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
NVIDIA BioNeMo NIM 微服务现可在 Claude Science 中运行,用于蛋白质结构预测。该集成面向智能体式 AI 科研流程,让 AI 科学家能够读取论文、提出假设、调用模型并确定后续实验优先级。BioNeMo NIM 此前已在软件工程领域验证价值,如今扩展至更需迭代的科学研究场景。
NVIDIA Omniverse NuRec 用于跨车型平台扩展自动驾驶感知,解决同一套感知软件换到新车型后感知结果变化的问题。传感器布局、标定、视场、遮挡、车身几何、时序与覆盖范围都会随车型改变,例如交通灯在画面中的位置可能不同。
NVIDIA 推出 TensorRT Model Connect,一个开源参考实现集合,可用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理和运行时适配代码。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA 介绍了一套用 AI 智能体训练跨本体机器人导航策略的方法,让导航能力迁移到新机器人或新场景时不再需要重新准备数据、仿真资产和机器人接口。导航与运动控制不同,需持续定位、理解变化的环境、选择路线并避障。
阿里发布 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览,供开发者实验和评估。该模型是多模态 MoE 模型,主模型 125B 参数,另有 51B N-gram 嵌入向量,每 token 激活 6B 参数,原生上下文窗口 262,144 token,可扩展至 1M token。NVIDIA 开发者博客介绍了在 GB300 NVL72 上针对智能体编码的实验。
推荐理由:阿里开放 Qwen3.8-Flash-Next 权重供开发者试用,可据此了解 Qwen4 架构预览版的 MoE 规格与长上下文能力。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
NVIDIA 发布 CUDA Python 1.0,主打稳定 API、统一基础和全平台访问。文章回顾了 Python 开发者使用 GPU 的两条路径,一是自己用 CUDA C++ 写扩展并维护绑定,二是依赖 PyTorch、CuPy、RAPIDS 等上层库,后者虽让 Python GPU 生态繁荣但存在局限。
推荐理由:CUDA Python 1.0 把稳定 API 与全平台访问作为目标,读者可据此判断 Python 开发者接入 GPU 的路径变化。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络成为首要性能瓶颈。NVIDIA 指出,传统商用 Ethernet 虽长期主导企业与云网络,但已难以支撑这一规模。Spectrum-X Ethernet 被定位为针对 Giga-Scale AI 的网络方案。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 量增长约四倍,反映 AI 智能体推理已从单轮交互扩展为多步工作流。
NVIDIA 介绍 Groq 3 LPX,这是面向 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器。平台核心是 NVIDIA Vera Rubin NVL72,覆盖从小模型到大模型、开源与闭源在内的广泛 AI 工作负载,兼顾高吞吐与交互性;Groq 3 LPX 与 Vera Rubin NVL72 搭配可扩展该平台的能力。
推荐理由:原文说明 Groq 3 LPX 与 Vera Rubin NVL72 的搭配方式,读者可了解长上下文交互推理的硬件组合思路。
NVIDIA BlueField-4 面向智能体 AI 工厂提供新型 Scale-In 网络基础设施,用于支撑每服务器多太比特带宽下的线速网络、存储与安全处理。传统云基础设施面向可预测的通用工作负载和标准接口设计,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算,因此专用 DPU 处理成为必需。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分功耗,并非每兆瓦都能转化为产生收入的算力。
NVIDIA 指出,智能体 AI 负载高度不可预测且波动大,与传统计算稳定的运行时特征不同。在 AI 工厂中,GPU 负责运行模型,CPU 则承担编排、工具执行与沙箱计算,集群经济性取决于整栈将电力与资本转化为已完成智能体任务的效率。
NVIDIA 介绍 GPU 加速矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该方法面向量化策略中的投资组合构建、风险聚合、统计套利和交易监控等场景,错误的工具分组会带来风险。
NVIDIA 宣布其 AVO 在 ARC-AGI-3 上达到 100%,称其展示了面向长时程自主智能体的前沿级通用架构。文章指出前沿语言模型只是 AI 智能体的一部分,外围的 harness 决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中保持进展。
推荐理由:NVIDIA 公布 AVO 在 ARC-AGI-3 上的成绩,读者可了解其面向长时程自主智能体的架构思路。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时的二元问答任务,用户用自然语言写出策略,模型输出校准后的安全分数,无需重新训练即可适配新策略,文本安全表现可匹配最高 7 倍参数量的开放 guard 模型。模型可在单张 16GB NVIDIA GPU 上运行,统一处理文本、图像及文本加图像内容。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定危害分类,读者可据此判断内容审核的部署方式变化。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 推理库加速。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出显存与延迟对比数据,可据此判断消费级 GPU 跑扩散模型的门槛变化。