跳到正文
9月23日周三
  1. OpenAI News60

    OpenAI 为 GPT-6 改进提示词缓存

    OpenAI 宣布为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。官方称这些改动用于减少延迟与费用,具体用法和参数未在摘要中给出。

    推荐理由:官方说明 GPT-6 提示词缓存的变化,读者可据此了解缓存命中率与延迟成本控制的新入口。

9月22日周二
  1. Hugging Face Blog62

    transformers 新增 llama.cpp GGUF 量化模型支持

    Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。

    推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。

9月21日周一
  1. NVIDIA Newsroom40

    NVIDIA 谈 AI 安全:如何在智能体栈的每一层解决这一工程问题

    NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、责任人和防护有效的证据,并主张在模型、harness 与运行时构成的智能体栈各层都部署管控。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。

9月19日周六
9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。

  2. NVIDIA Developer Blog22

    NVIDIA 用智能体 AI 将 CUDA Tile 操作从 Python 翻译到 Rust

    NVIDIA 借助智能体 AI 把 CUDA Tile 操作从 Python 翻译为 Rust,用于 cuTile Rust(cutile-rs)这一基于 tile 的 GPU kernel 编写系统。该系统将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的分片,并在 kernel 启动间保持主机侧所有权契约,同时允许程序员在需要底层控制时局部退出。

9月16日周三
  1. NVIDIA Newsroom67

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。

9月15日周二
9月12日周六
9月11日周五
9月10日周四
  1. Mistral AI38

    Mistral 与 Cloudera 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还可在受控环境内用专有数据训练定制模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上客户管理的数据规模达 30 exabytes。

9月9日周三
  1. Mistral AI40

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 编写的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。迁移前先构建数值一致性校验框架,让 Fortran 导出状态快照供 C++ 测试比对;随后用 Vibe CLI 启动上百个智能体解析调用树并生成文档。最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移,兼顾代码质量与卡点解阻。

9月8日周二
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 选用。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量数据,可据此判断多模型编排在编码任务上的取舍。

9月4日周五