NVIDIA Nemotron 微调适配沙特阿拉伯语方言,并可扩展至其他语言
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统。生成式推荐把推荐重构为用户行为序列建模,用户的交互、上下文、候选物品与动作都成为高基数事件流中的 token,而非孤立的召回、排序、预测阶段。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文件并返回带引用的答案。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。
推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。
NVIDIA 开源了 TensorRT Model Connect,一个基于 TensorRT、用 C++ 编写的 AI 模型参考实现集合,围绕编码智能体设计。项目采用并行开发、模型家族隔离、可回滚变更和 GPU 验证等实践,目标是让 NVIDIA 推理栈的性能更易被使用。
AWS 发布 Amazon Quick 提示词工程基础指南,这是两部分系列的第一篇,聚焦适用于 Quick 各组件(Research、Flows、Sight、Chat Agents、Action Integrations)的通用原则与可复用框架。文章提出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例演示能减少迭代、提升首次输出质量。
AWS 发文拆解 Amazon Quick 各组件的提示词写法差异:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定来源(Quick Index。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台方案,用 AI 智能体从合同 PDF 中提取八个关键字段并交叉验证,解决 RAG 语义检索无法跨数百份合同做聚合统计的问题。
AWS 发布 vLLM-Omni DLC(v1.5),可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出。
在 Amazon SageMaker AI 上,同一 AWS vLLM-Omni DLC 镜像可部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。
AWS 发布基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,用 CloudFormation 和 Terraform 模板把适配器 ID 外置到 Systems Manager Parameter Store,更新生产适配器引用无需重新部署应用,原本数小时到数天的协调缩短到数秒。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队的 Qwen3-TTS-12Hz-1.7B-Base 已上架 Amazon SageMaker JumpStart,可部署为全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。方案是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量、修正幅度小且锚定在用户当前视口,避免滚动跳变。
NVIDIA 发布 NodeWright,用于管理 Kubernetes 节点本身,覆盖内核设置、系统软件包、存储布局、安全代理以及 GPU 工作负载依赖的主机级调优。该工具针对团队目前依赖 Ansible playbook、自定义脚本和手动 runbook 的做法,这类方式在新区域新建集群或内核升级破坏 RDMA 时容易失效。
NVIDIA 介绍如何用 AI 智能体结合 Isaac ROS 加速 ROS 2 节点,解决 GPU 加速下消息在节点间仍经 CPU 内存序列化或拷贝、削弱感知与 AI 负载 GPU 收益的问题。方案依托新近加入的上游抽象与 CUDA buffer 后端,让消息在 GPU 上流转。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整任务完成度打分,核心是考察智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。
OpenAI Academy 新增面向员工、开发者、管理者、教育工作者和学生等多类人群的学习路径,用于培养和展示实用 AI 技能。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理性能基准测试。它针对 curl 命令、手写 asyncio 脚本或一次性负载生成器等传统压测方式的问题,这些方式受限于单进程性能、Python GIL 并发瓶颈,或测量基准不可靠。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。
NVIDIA 展示了一套智能体 AI 工作流,用于为物理 AI 系统准备和验证数字孪生:智能体可检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按 SimReady 要求验证结果。该流程覆盖从 Blender 场景到面向 NVIDIA 的仿真就绪 OpenUSD 交付。
NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。
NVIDIA 以 Nemotron 3.5 Lightning 为例说明 MoE 架构如何让 30B 参数模型每个 token 仅激活 3B 参数,同时保留大模型容量。文章对比 Dense 与 MoE 两种主流架构,指出参数组织方式与参数规模同样关键,并讨论活跃参数、吞吐量及各自适用场景。
NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决从单服务器、少量客户端扩展到共享基础设施的运维难题。随着项目增长,GPU 需按任务需求分配、多项研究需相互隔离,且每个参与机构都要保留对自身数据的控制权。
NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化管线,原本手工花两天准备的活动现在从单个 Issue 自动完成搭建、每日筛选报名者并在结束后清理。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需在编辑器、终端和浏览器之间切换即可审查、运行并预览 AI 智能体生成的代码改动。
NVIDIA 详解 Encode-Prefill-Decode(EPD)分离技术:将视觉编码器阶段与 prefill、decode 阶段拆开,在图像密集提示、中短输出和量化 MoE 模型上收益最大。配合 NVIDIA Dynamo 使用,多模态模型服务最高可提速 5 倍。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 编写的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。迁移前先构建数值一致性校验框架,让 Fortran 导出状态快照供 C++ 测试比对;随后用 Vibe CLI 启动上百个智能体解析调用树并生成文档。最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移,兼顾代码质量与卡点解阻。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存企业工作中的消息、决策、项目和待办事项等随时间变化的上下文。该智能体无需在每次启动时重建上下文,即可直接基于已有记忆参与工作。
NVIDIA 发布指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型因体积过大只能把推理请求回传数据中心,带来网络依赖、成本上升和本地数据外泄风险,这一限制正在被打破。
NVIDIA 发文讲解如何在联邦 Kubernetes 与 AI 平台之间传递用户身份。现代 AI 平台中,用户可能从中央门户进入、打开受治理数据集、在数据所在处启动 notebook,并调用另一个集群中服务,身份在每一步都要跨越控制面与数据面边界,传统单点登录在此失效。
GitHub Copilot 应用支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在会话视图中查看各任务标题与进度,随时切换而不必重新说明背景。官方建议先同时启动两个小任务来体验并行智能体会话。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 开发者博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的五条准则。文章同时讨论了模型设计选择如何在不牺牲精度的情况下影响吞吐量与交互性。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
NVIDIA 推出 TensorRT Model Connect,一个开源参考实现集合,可用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理和运行时适配代码。