NVIDIA 推出 cuObject 与 SCADA Server SDK,扩展 AI 存储访问
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,成为较早交付该平台的云厂商之一,Cognition 是首个在 Vera Rubin 上跑生产负载的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力走向。
三星电子、三星物产、三星 SDS、三星 SDI、三星生命和三星火灾海上保险宣布联合向 AI 基础设施公司 Helix Digital Infrastructure 投资 10 亿美元。
推荐理由:三星六家关联公司联合投资 Helix,读者可借此了解 AI 数据中心竞争正从算力延伸到电力与基础设施。
NVIDIA 董事会批准将股票回购计划授权额度增加 1500 亿美元,使剩余总授权规模升至 2350 亿美元,为公司史上最大规模的回购授权上调。公司预计在 2028 财年前执行完剩余回购计划。CEO 黄仁勋称,AI 与加速计算带来的平台级转变推动公司增长,现金流足以支撑技术投入与股东回报。
三星电子作为唯一供应商,联合 SK Telecom 为韩亚金融集团仁川新总部部署私有 5G 网络,建成韩国金融业首个智能办公项目,覆盖总部 16 层、多个集团子公司及数千名员工。方案采用 4.7GHz 中频段、5G Standalone Core 与网络切片,各子公司可使用独立切片,并配备加密、防火墙、DDoS 防护和 USIM 认证等多层安全机制。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,让客户在正常运行时不必为 GPU 峰值功耗预留保护性缓冲。AI 工厂通常按所有 GPU 同时达到峰值功耗的极端情况配置电力,导致大量基础设施在平时处于闲置状态。
AWS 在 Amazon EKS 上结合 EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、PPO 和 GRPO 等大规模训练流程。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日登陆 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
三星电子与 KT、SK Telecom 签署韩国科学技术信息通信部“Hyper AI Network”计划下的 AI RAN 项目合同,分别担任 KT 的独家全球供应商和 SK Telecom 的主要供应商,是唯一同时入选两个项目的合作伙伴。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄将流量导向更慢路径。这类问题往往要到训练运行数小时后才被发现。
NVIDIA 发布 NodeWright,用于管理 Kubernetes 节点本身,覆盖内核设置、系统软件包、存储布局、安全代理以及 GPU 工作负载依赖的主机级调优。该工具针对团队目前依赖 Ansible playbook、自定义脚本和手动 runbook 的做法,这类方式在新区域新建集群或内核升级破坏 RDMA 时容易失效。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统工程实验室负责产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统层面被识别时,全球首次实现 Rubin GPU 系统级枚举,团队当场欢呼庆祝。她将验证工作比作破案,目标是在客户发现问题之前先找出问题,单块板卡可能含数万个元件,一个机架接近 50 万个。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,为 LLM 推理提供可信执行环境。该方案面向个人、企业和受监管场景中处理敏感信息与专有模型上下文的推理负载,支持私有高性能生产级 AI 推理。
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度,解决放置不当导致拓扑域碎片化、流量被迫走共享链路的问题。该方案针对功耗受限的 AI 工厂,可避免吞吐下降与作业成本上升,并减少 GPU 空耗电力等待数据的情况。
苹果新款 Mac mini 与 Mac Studio 于 9 月 22 日开售,Mac mini 搭载 M6 与 M5 Pro,Mac Studio 搭载 M5 Max 与全新 M5 Ultra。
推荐理由:苹果官方给出新 Mac mini 与 Mac Studio 的芯片配置、AI 性能倍数与售价,可据此判断端侧 AI 工作站的规格与入手成本。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 在埃及大埃及博物馆举办活动,展示当地 AI 生态从能力建设走向生产规模,其 Deep Learning Institute 埃及学员基数一年增长超十倍。
NVIDIA 发布 Halos 全栈安全系统,覆盖物理 AI 从硬件、软件到 AI 行为与部署验证的每一层,用于自动驾驶与机器人。ABI Research 预计 2035 年 L3-5 自动驾驶汽车保有量达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
Pawprint Studio 的 Aniimo 本周首发上线 GeForce NOW,这是一款免费开放世界捉宠 RPG,玩家可用 Aniipods 捕捉生物并 Twine 变身,无需等待 45GB 下载。
NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该方案面向从云端数据中心迁移到车辆、机器人等边缘设备的 AI 智能体,针对其多步骤工具调用、结果评估与长对话推理带来的边缘推理新需求,实现快速 token 生成。
NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信操作以同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高交互、高能效推理。文章指出,AI 工厂的核心约束是功耗,因此每瓦性能而非原始吞吐量才是衡量 AI 平台价值的最终标准。Vera Rubin 平台正是围绕这一目标设计。
NVIDIA 通过全栈 NIM 优化,让 Nemotron 3 Ultra 在相同 GPU 基础设施上可服务的并发用户数提升 2.5 倍,同时保持应用交互响应。该优化针对智能体 AI 负载中提示词长、上下文跨步骤复用等特点,在生产部署中平衡并发量与交互性。
NVIDIA 发布 CUDA Toolkit 13.4,新增 Windows on Arm 平台支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 提供支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
三星电子宣布与 Mistral AI 达成战略合作,将在半导体业务中引入 Mistral 的 AI 服务与解决方案,包括旗舰大语言模型 Mistral Large,用于开发面向智能化基础设施的定制本地部署 AI 模型。
三星电子与 ASML 宣布扩大长期战略合作,深化 High NA EUV 光刻与先进半导体制造技术协作。三星将加入推动下一代 12 英寸光罩技术的行业计划,取代沿用数十年的 6 英寸光罩格式,以提升晶圆厂产能、降低芯片制造成本并消除拼接限制。三星还计划在 2028 年前首次将 ASML 的 High NA EUV 引入 DRAM 大规模量产。
推荐理由:三星与 ASML 扩大 High NA EUV 合作并推动 12 英寸光罩,可了解先进制程与 DRAM 制造路线的下一步。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力容量、基础设施和商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司最大股权融资,读者可了解其主权 AI 全栈定位与投资方阵容。
NVIDIA 宣布推出 CUDA Rust,为 Rust 提供两条编写 GPU 内核的路径,并计划将其持续发展和成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,CUDA Rust 面向推理引擎、服务基础设施、驱动和智能体运行时等频繁变化的 AI 系统层。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
三星将在 8 月 26-30 日于德国科隆举办的 Gamescom 2026 上,以 1,090 平方米展区展示覆盖 PC、主机与手游的游戏生态,并首发 2027 Odyssey 游戏显示器全系与新款便携 SSD。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络成为首要性能瓶颈。NVIDIA 指出,传统商用 Ethernet 虽长期主导企业与云网络,但已难以支撑这一规模。Spectrum-X Ethernet 被定位为针对 Giga-Scale AI 的网络方案。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 量增长约四倍,反映 AI 智能体推理已从单轮交互扩展为多步工作流。
NVIDIA 介绍 Groq 3 LPX,这是面向 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器。平台核心是 NVIDIA Vera Rubin NVL72,覆盖从小模型到大模型、开源与闭源在内的广泛 AI 工作负载,兼顾高吞吐与交互性;Groq 3 LPX 与 Vera Rubin NVL72 搭配可扩展该平台的能力。
推荐理由:原文说明 Groq 3 LPX 与 Vera Rubin NVL72 的搭配方式,读者可了解长上下文交互推理的硬件组合思路。
NVIDIA BlueField-4 面向智能体 AI 工厂提供新型 Scale-In 网络基础设施,用于支撑每服务器多太比特带宽下的线速网络、存储与安全处理。传统云基础设施面向可预测的通用工作负载和标准接口设计,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算,因此专用 DPU 处理成为必需。