跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分62

vLLM 的 transformers 建模后端实现原生速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到或超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超越原生吞吐。

推荐理由

原文给出 transformers 后端在 vLLM 中追平原生实现的具体架构与并行配置,读者可据此判断迁移成本。

来源:Hugging Face Blog · huggingface.co