Infineon 发布 PCIe Gen 4 x4 参考设计,推动 USB 20 Gbps 生态支持 5 米线缆与 36W 供电
Infineon 在 VISION Stuttgart 2026 上发布业界首个独立 PCIe Gen 4 x4 扩展卡参考设计,集成 ASMedia ASM4242 USB4 主控与 EZ-PD CCG7 PD 控制器,可在 5 米被动 USB 线缆上实现 USB 20 Gbps(USB 3.2 Gen 2×2)稳定传输。
Infineon 在 VISION Stuttgart 2026 上发布业界首个独立 PCIe Gen 4 x4 扩展卡参考设计,集成 ASMedia ASM4242 USB4 主控与 EZ-PD CCG7 PD 控制器,可在 5 米被动 USB 线缆上实现 USB 20 Gbps(USB 3.2 Gen 2×2)稳定传输。
QNAP 发布 QSW-M5218 系列 L3 Lite 管理型交换机,含 QSW-M5218-6F12T 与支持 PoE 的 QSW-M5218P-6F12T,配备 12 个 10GbE RJ45 端口和 6 个 25GbE SFP28 上行端口,交换容量最高 540 Gbps。
Linux 内核 7.4 将合入名为 PerfOpt 的补丁,允许 AMD 集成 GPU 绕过 IOMMU 直接访问系统内存,从而降低系统开销。据 Phoronix 测试,AMD Strix Halo APU 上的本地 LLM 性能最高可提升 18-23%。该补丁对 Valve Steam Deck 等低功耗 AMD 掌机尤为重要,CachyOS 等发行版可能更早获得支持。
技嘉发布 AI TOP 100 B850 台式整机,支持 1 张 NVIDIA GeForce RTX 5090 或 2 张 AMD Radeon AI PRO R9700 显卡。
英飞凌发布 USB 3.2 Gen 2×2(20Gbps)Type-C 接口 PCIe AIC 参考设计,上行侧为 PCIe Gen4 ×4,搭载祥硕 USB4 主机控制器 ASM4242 与英飞凌 EZ-PD CCG7 USB PD 控制器,下行提供 2 个支持 36W PD 输出的 USB-C,可通过 5m 无源数据线传输 20Gbps 信号。
面向数据中心设备的开源硅信任根架构 Caliptra 正获得多家云与半导体公司支持,云和数据中心运营商开始要求芯片供应商提供符合 Caliptra 商标要求的实现,供应商须通过对照集成清单的一致性评估。选定该架构只是起点,商业部署还需解决跨 SoC 信任扩展、密钥服务接口、安全启动协同、认证目标与生命周期管理等工程问题,信任根也正从孤立安全锚点演变为平台级安全编排者。
西门子 Avery PCIe 与 UCIe VIP 提供协议感知的端到端验证框架,用于验证 PCIe 流量经 UCIe 3.0 跨芯粒边界的传输。该方案覆盖电源管理、复位、恢复、事务排序与错误处理,并可在同一时间线上追踪 PCIe 侧活动与 UCIe flit 收发,在流片前暴露跨层集成缺陷。
Emergence AI 正把其神经形式化 AI 技术推向无晶圆厂半导体公司的实际部署,用 LLM 提出方案、符号 AI 验证,给出可证明正确的答案。该技术通过分析晶圆与终测数据定位良率异常根因,并已开始切入先进封装,用有限元和多尺度物理仿真排查 CTE 失配等问题。公司计划两年内将工程师与研发科学家扩充至 500 人,印度业务聚焦半导体。
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
Astera Labs 推出 Leo X-Series fabric-attached 内存控制器及新一代 Leo 2 E-Series、P-Series,针对 LLM 向多轮智能体系统演进时的内存性能优化。
IC-STAR 面向硅片开发全生命周期,让工程师从手动管理工具与交接转为定义目标并监督 AI 驱动的执行。该方案涉及四项支撑硅设计自主化的关键技术,可加速复杂工程工作流,并已在 Ambiq 的生产环境中部署落地。
Synopsys 发布 AgentEngineer 解决方案组合,基于新的 Autopilot 平台,覆盖验证、系统验证、实现、模拟与混合信号设计、制造、仿真与分析六个领域,公司称已有 50 多个客户合作项目在进行,计划 2026 年底正式可用。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,让客户在正常运行时不必为 GPU 峰值功耗预留保护性缓冲。AI 工厂通常按所有 GPU 同时达到峰值功耗的极端情况配置电力,导致大量基础设施在平时处于闲置状态。
AWS 在 Amazon EKS 上结合 EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、PPO 和 GRPO 等大规模训练流程。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄将流量导向更慢路径。这类问题往往要到训练运行数小时后才被发现。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,为 LLM 推理提供可信执行环境。该方案面向个人、企业和受监管场景中处理敏感信息与专有模型上下文的推理负载,支持私有高性能生产级 AI 推理。
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度,解决放置不当导致拓扑域碎片化、流量被迫走共享链路的问题。该方案针对功耗受限的 AI 工厂,可避免吞吐下降与作业成本上升,并减少 GPU 空耗电力等待数据的情况。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 通过全栈 NIM 优化,让 Nemotron 3 Ultra 在相同 GPU 基础设施上可服务的并发用户数提升 2.5 倍,同时保持应用交互响应。该优化针对智能体 AI 负载中提示词长、上下文跨步骤复用等特点,在生产部署中平衡并发量与交互性。
NVIDIA 发布 CUDA Toolkit 13.4,新增 Windows on Arm 平台支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 提供支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
NVIDIA 宣布推出 CUDA Rust,为 Rust 提供两条编写 GPU 内核的路径,并计划将其持续发展和成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,CUDA Rust 面向推理引擎、服务基础设施、驱动和智能体运行时等频繁变化的 AI 系统层。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分功耗,并非每兆瓦都能转化为产生收入的算力。