Grab 与 OpenAI 推出 GO Forward with AI,为东南亚 3 万合作伙伴培训 AI 技能
OpenAI 与 Grab 联合推出区域性项目 GO Forward with AI,计划帮助东南亚 30,000 名合作伙伴掌握实用 AI 技能。该项目面向 Grab 合作伙伴群体,聚焦实际应用能力的培养。
OpenAI 与 Grab 联合推出区域性项目 GO Forward with AI,计划帮助东南亚 30,000 名合作伙伴掌握实用 AI 技能。该项目面向 Grab 合作伙伴群体,聚焦实际应用能力的培养。
OpenAI 宣布为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。官方称这些改动用于减少延迟与费用,具体用法和参数未在摘要中给出。
推荐理由:官方说明 GPT-6 提示词缓存的变化,读者可据此了解缓存命中率与延迟成本控制的新入口。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,为 LLM 推理提供可信执行环境。该方案面向个人、企业和受监管场景中处理敏感信息与专有模型上下文的推理负载,支持私有高性能生产级 AI 推理。
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度,解决放置不当导致拓扑域碎片化、流量被迫走共享链路的问题。该方案针对功耗受限的 AI 工厂,可避免吞吐下降与作业成本上升,并减少 GPU 空耗电力等待数据的情况。
NVIDIA 介绍如何用 AI 智能体结合 Isaac ROS 加速 ROS 2 节点,解决 GPU 加速下消息在节点间仍经 CPU 内存序列化或拷贝、削弱感知与 AI 负载 GPU 收益的问题。方案依托新近加入的上游抽象与 CUDA buffer 后端,让消息在 GPU 上流转。
Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 生态建设。oMLX 将从副业转为有资金支持的长期项目,继续以 Apache 2.0 开源并由 Jun 继续主导,目标是让贡献者获得更稳定的维护和更快的开发节奏。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整任务完成度打分,核心是考察智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、责任人和防护有效的证据,并主张在模型、harness 与运行时构成的智能体栈各层都部署管控。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度最高提升数十倍。v1 将单个 crate 拆为工作区,引入 bitcannon 用 SIMD 位流替代正则做预分词、无分配合并工作集、线程本地词缓存和原生多线程并行,并保持对 BPE、WordPiece、Unigram 的通用支持。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理性能基准测试。它针对 curl 命令、手写 asyncio 脚本或一次性负载生成器等传统压测方式的问题,这些方式受限于单进程性能、Python GIL 并发瓶颈,或测量基准不可靠。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能能力,支持律所自定义工作流、接入法律数据源,并针对机密客户工作提供法律级管控。该产品归属于 OpenAI for Law。
NVIDIA 展示了一套智能体 AI 工作流,用于为物理 AI 系统准备和验证数字孪生:智能体可检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按 SimReady 要求验证结果。该流程覆盖从 Blender 场景到面向 NVIDIA 的仿真就绪 OpenUSD 交付。
NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
NVIDIA 以 Nemotron 3.5 Lightning 为例说明 MoE 架构如何让 30B 参数模型每个 token 仅激活 3B 参数,同时保留大模型容量。文章对比 Dense 与 MoE 两种主流架构,指出参数组织方式与参数规模同样关键,并讨论活跃参数、吞吐量及各自适用场景。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决从单服务器、少量客户端扩展到共享基础设施的运维难题。随着项目增长,GPU 需按任务需求分配、多项研究需相互隔离,且每个参与机构都要保留对自身数据的控制权。
NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化管线,原本手工花两天准备的活动现在从单个 Issue 自动完成搭建、每日筛选报名者并在结束后清理。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于满足 ChatGPT 在线存储的规模化需求。
NVIDIA 通过全栈 NIM 优化,让 Nemotron 3 Ultra 在相同 GPU 基础设施上可服务的并发用户数提升 2.5 倍,同时保持应用交互响应。该优化针对智能体 AI 负载中提示词长、上下文跨步骤复用等特点,在生产部署中平衡并发量与交互性。
NVIDIA BioNeMo Inference Runtime(BioIR)可在 NVIDIA GPU 上加速受支持的生物分子结构预测模型,同时保留熟悉的 PyTorch 工作流。它通过优化 kernel 并在适用场景使用 CUDA Graphs 提升模型速度,面向蛋白质组规模、需高效跑完整个工作列表的预测任务。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还可在受控环境内用专有数据训练定制模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上客户管理的数据规模达 30 exabytes。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方及部落政府提供 $0 许可费、50% 用量折扣,并扩大网络防御支持。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,训练与推理分别跑在独立的 Hugging Face Jobs 上。
NVIDIA 详解 Encode-Prefill-Decode(EPD)分离技术:将视觉编码器阶段与 prefill、decode 阶段拆开,在图像密集提示、中短输出和量化 MoE 模型上收益最大。配合 NVIDIA Dynamo 使用,多模态模型服务最高可提速 5 倍。
NVIDIA 发布 CUDA Toolkit 13.4,新增 Windows on Arm 平台支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 提供支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 编写的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。迁移前先构建数值一致性校验框架,让 Fortran 导出状态快照供 C++ 测试比对;随后用 Vibe CLI 启动上百个智能体解析调用树并生成文档。最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移,兼顾代码质量与卡点解阻。
NVIDIA 宣布推出 CUDA Rust,为 Rust 提供两条编写 GPU 内核的路径,并计划将其持续发展和成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,CUDA Rust 面向推理引擎、服务基础设施、驱动和智能体运行时等频繁变化的 AI 系统层。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
NVIDIA 发布指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型因体积过大只能把推理请求回传数据中心,带来网络依赖、成本上升和本地数据外泄风险,这一限制正在被打破。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 选用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量数据,可据此判断多模型编排在编码任务上的取舍。
NVIDIA 发文讲解如何在联邦 Kubernetes 与 AI 平台之间传递用户身份。现代 AI 平台中,用户可能从中央门户进入、打开受治理数据集、在数据所在处启动 notebook,并调用另一个集群中服务,身份在每一步都要跨越控制面与数据面边界,传统单点登录在此失效。
GitHub Copilot 应用支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在会话视图中查看各任务标题与进度,随时切换而不必重新说明背景。官方建议先同时启动两个小任务来体验并行智能体会话。