跳到正文
9月25日周五
9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。方案是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量、修正幅度小且锚定在用户当前视口,避免滚动跳变。

  2. NVIDIA Developer Blog18

    NVIDIA 推出 NodeWright,管理 Kubernetes 节点集群

    NVIDIA 发布 NodeWright,用于管理 Kubernetes 节点本身,覆盖内核设置、系统软件包、存储布局、安全代理以及 GPU 工作负载依赖的主机级调优。该工具针对团队目前依赖 Ansible playbook、自定义脚本和手动 runbook 的做法,这类方式在新区域新建集群或内核升级破坏 RDMA 时容易失效。

9月23日周三
  1. OpenAI News60

    OpenAI 为 GPT-6 改进提示词缓存

    OpenAI 宣布为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。官方称这些改动用于减少延迟与费用,具体用法和参数未在摘要中给出。

    推荐理由:官方说明 GPT-6 提示词缓存的变化,读者可据此了解缓存命中率与延迟成本控制的新入口。

9月22日周二
  1. Hugging Face Blog62

    transformers 新增 llama.cpp GGUF 量化模型支持

    Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。

    推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。

  2. Simon Willison47

    Cloudflare Python Workers 正式 GA

    Cloudflare 的 Python Workers 在经历两年预览后正式 GA,Python 成为其开发者平台的一等支持语言。该方案通过 Pyodide 将 Python 编译为 WebAssembly,运行在基于 V8 的 workerd 运行时中,但 multiprocessing 与 threading 在 WebAssembly VM 中不可用。

9月21日周一
  1. NVIDIA Newsroom40

    NVIDIA 谈 AI 安全:如何在智能体栈的每一层解决这一工程问题

    NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、责任人和防护有效的证据,并主张在模型、harness 与运行时构成的智能体栈各层都部署管控。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。

9月19日周六
9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。

  2. NVIDIA Developer Blog22

    NVIDIA 用智能体 AI 将 CUDA Tile 操作从 Python 翻译到 Rust

    NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。

9月16日周三
  1. NVIDIA Newsroom67

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。

9月15日周二
9月12日周六
9月11日周五