跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–15 条 · 共 16 条
9月30日周三
  1. AWS Machine Learning Blog60

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。

    推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。

  2. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。

    推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。

  2. AWS Machine Learning Blog70

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。

9月28日周一
  1. Hugging Face Blog72

    H 公司发布 Holo4 系列智能体模型,覆盖 GUI、代码、MCP 与 API

    H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时推出 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可运行在桌面、网页、Android、代码沙箱和企业 API 上。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用型 computer-use 智能体的成本与能力边界。

  2. NVIDIA Newsroom78

    NVIDIA 发布 Open Agent Safety Platform,从测试到部署保障 AI 智能体安全

    NVIDIA 发布 NVIDIA Open Agent Safety Platform,由开源软件 NVIDIA OpenShell 与 NVIDIA Sentry 参考系统设计组成,覆盖运行智能体的软件、硬件、算力与机器人系统。

    推荐理由:NVIDIA 把智能体安全边界从模型层移到运行时与硬件层,读者可据此了解企业级智能体治理的一种新架构。

9月24日周四
9月22日周二
  1. Hugging Face Blog62

    transformers 新增 llama.cpp GGUF 量化模型支持

    Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。

    推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。

9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,分布在 128 个 PR 中增量合入 main。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 80 万行 Rust 的全过程,含多智能体协作与提示缓存数据。

9月16日周三
  1. NVIDIA Newsroom67

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin NVL72 相对 GB300 的吞吐提升与 99% 扩展效率,可据此判断推理基础设施的性价比走向。

9月3日周四
8月20日周四
  1. Mistral AI69

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率从 26.7% 升至 86%

    Mistral 发布 Agentic Search,一个面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在索引之上迭代查找并核对证据。

    推荐理由:Mistral 给出 Agentic Search 在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可对照传统 RAG 判断检索层改造的收益。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与 Priority Tier,并接入 GLM-5.2

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、SLA 保障层级与第三方开源模型接入打包成一套主权 AI 方案,可据此判断企业部署时的区域与合规选项。

8月4日周二
7月29日周三