NVIDIA CUDA 工具链实战:六步优化图像处理流水线
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
NVIDIA 开发者博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的五条准则。文章同时讨论了模型设计选择如何在不牺牲精度的情况下影响吞吐量与交互性。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
NVIDIA 推出 TensorRT Model Connect,一个开源参考实现集合,可用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理和运行时适配代码。
NVIDIA 介绍了一套用 AI 智能体训练跨本体机器人导航策略的方法,让导航能力迁移到新机器人或新场景时不再需要重新准备数据、仿真资产和机器人接口。导航与运动控制不同,需持续定位、理解变化的环境、选择路线并避障。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并给出完整训练方案。
NVIDIA 介绍 GPU 加速矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该方法面向量化策略中的投资组合构建、风险聚合、统计套利和交易监控等场景,错误的工具分组会带来风险。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建混合搜索系统,为超 11 万篇 arXiv 与 Daily Papers 论文提供检索。
Hugging Face 博客介绍其自研的约束感知 GPU 分配器,在相同硬件与负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了一条智能体数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 在 AppWorld Test Challenge 上用同一 CodeAct 智能体跑 417 个任务发现,Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),原因是缓存读取定价而非标价。
Hugging Face 博客发布 "Profiling in PyTorch" 系列第三部分,用 NVIDIA A100-SXM4-80GB 剖析注意力机制的 profiler 轨迹。文章对比朴素注意力、原地操作(masked_fill_)和 SDPA 等实现,发现将 masked_fill 改为原地操作可消除一次 Memcpy kernel,在多层 Transformer 中逐层累积节省。
Hugging Face 发布 PRX 系列第四篇,详解其 7B 模型的数据策略:预训练数据由公开与内部数据集混合而成,并用 VLM 重新生成图像长描述。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多花约 1 天)。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试并在 CI/CD 中无人值守运行,多个实例可并行处理不同文件。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件和自定义工具,将质量分从 0.68 提升至 0.74。
Mistral AI 在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1 的 Prefill/Decode 分离部署中,开启 graph compilation 后系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Mistral 通过 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)的 8000 训练样本与 2000 测试样本上显著优于未微调基线。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集取平均得到加权总分。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中建单。