Datasette 1.0a41 发布:新增 OpenTelemetry 支持
Datasette 1.0a41 发布,Alec Garcia 为该版本加入了 OpenTelemetry 支持。同时,Datasette 的所有模态对话框被重构为单一 Web Component,并已开放文档供其他插件使用。
Datasette 1.0a41 发布,Alec Garcia 为该版本加入了 OpenTelemetry 支持。同时,Datasette 的所有模态对话框被重构为单一 Web Component,并已开放文档供其他插件使用。
随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄将流量导向更慢路径。这类问题往往要到训练运行数小时后才被发现。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。方案是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量、修正幅度小且锚定在用户当前视口,避免滚动跳变。
NVIDIA 发布 NodeWright,用于管理 Kubernetes 节点本身,覆盖内核设置、系统软件包、存储布局、安全代理以及 GPU 工作负载依赖的主机级调优。该工具针对团队目前依赖 Ansible playbook、自定义脚本和手动 runbook 的做法,这类方式在新区域新建集群或内核升级破坏 RDMA 时容易失效。
一份可交互示例讲解 shadow roots 与 shadow DOM,演示样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以特定受控方式与页面 DOM 交互。该示例由 Fable 5.1 Medium 根据提示词生成。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对机器人推理卸载的系统性测量,给出任务成功率、电池续航与 Kubernetes 工具链的具体数据。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评估推理服务软件改动在完整服务路径上的表现,包含 53 个任务。该工具针对 AI 编程智能体的补丁能通过测试、却在服务器加载真实模型并处理请求时失败的问题,检查系统能否通过公开接口返回正确结果。
OpenAI 与 Grab 联合推出区域性项目 GO Forward with AI,计划帮助东南亚 30,000 名合作伙伴掌握实用 AI 技能。该项目面向 Grab 合作伙伴群体,聚焦实际应用能力的培养。
OpenAI 宣布为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。官方称这些改动用于减少延迟与费用,具体用法和参数未在摘要中给出。
推荐理由:官方说明 GPT-6 提示词缓存的变化,读者可据此了解缓存命中率与延迟成本控制的新入口。
Simon Willison 于 9 月 22 日发布 llm 0.36。该版本属于其 llm 命令行工具与 Python 库的更新,具体改动原文未列出。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,为 LLM 推理提供可信执行环境。该方案面向个人、企业和受监管场景中处理敏感信息与专有模型上下文的推理负载,支持私有高性能生产级 AI 推理。
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度,解决放置不当导致拓扑域碎片化、流量被迫走共享链路的问题。该方案针对功耗受限的 AI 工厂,可避免吞吐下降与作业成本上升,并减少 GPU 空耗电力等待数据的情况。
Simon Willison 发布 llm-anthropic 0.29,这是 LLM 工具调用 Anthropic 模型的插件更新。原文未披露该版本的具体功能、参数或可用性细节。
Simon Willison 发布 LLM 插件 llm-typesafe 0.1a0,为 TypeSafe AI 的新模型 Jev 提供支持,可通过 `llm install llm-typesafe` 安装并设置 API key。
NVIDIA 介绍如何用 AI 智能体结合 Isaac ROS 加速 ROS 2 节点,解决 GPU 加速下消息在节点间仍经 CPU 内存序列化或拷贝、削弱感知与 AI 负载 GPU 收益的问题。方案依托新近加入的上游抽象与 CUDA buffer 后端,让消息在 GPU 上流转。
Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 生态建设。oMLX 将从副业转为有资金支持的长期项目,继续以 Apache 2.0 开源并由 Jun 继续主导,目标是让贡献者获得更稳定的维护和更快的开发节奏。
TypeSafe AI 发布 Jev,一种被称为 System One 或决策模型的新形态模型,输入文本后不返回文本,而是返回类别、是/否判断、评分及对应置信分数。
Cloudflare 的 Python Workers 在经历两年预览后正式 GA,Python 成为其开发者平台的一等支持语言。该方案通过 Pyodide 将 Python 编译为 WebAssembly,运行在基于 V8 的 workerd 运行时中,但 multiprocessing 与 threading 在 WebAssembly VM 中不可用。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整任务完成度打分,核心是考察智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、责任人和防护有效的证据,并主张在模型、harness 与运行时构成的智能体栈各层都部署管控。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
一名入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD 和工单均由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。管理层多次表示推送代码不是瓶颈,员工每天工作 12 到 13 小时只为按回车,没人阅读任何内容,团队无人喜欢这种状态。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理性能基准测试。它针对 curl 命令、手写 asyncio 脚本或一次性负载生成器等传统压测方式的问题,这些方式受限于单进程性能、Python GIL 并发瓶颈,或测量基准不可靠。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能能力,支持律所自定义工作流、接入法律数据源,并针对机密客户工作提供法律级管控。该产品归属于 OpenAI for Law。
NVIDIA 展示了一套智能体 AI 工作流,用于为物理 AI 系统准备和验证数字孪生:智能体可检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按 SimReady 要求验证结果。该流程覆盖从 Blender 场景到面向 NVIDIA 的仿真就绪 OpenUSD 交付。
NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
NVIDIA 以 Nemotron 3.5 Lightning 为例说明 MoE 架构如何让 30B 参数模型每个 token 仅激活 3B 参数,同时保留大模型容量。文章对比 Dense 与 MoE 两种主流架构,指出参数组织方式与参数规模同样关键,并讨论活跃参数、吞吐量及各自适用场景。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证:Lambda 在 5 机架 19 节点 HGX B200 集群上,用 16 节点的功耗跑出 24% 的 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决从单服务器、少量客户端扩展到共享基础设施的运维难题。随着项目增长,GPU 需按任务需求分配、多项研究需相互隔离,且每个参与机构都要保留对自身数据的控制权。
NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化管线,原本手工花两天准备的活动现在从单个 Issue 自动完成搭建、每日筛选报名者并在结束后清理。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于满足 ChatGPT 在线存储的规模化需求。