跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分65

Hugging Face:vLLM 的 transformers 后端达到原生实现速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 宣布 vLLM 的 transformers modeling backend 现在对多种 LLM 架构达到与 vLLM 手写原生实现相同或更快的吞吐。

推荐理由

官方实测显示 transformers 后端在三种 Qwen3 配置上达到或超过 vLLM 原生吞吐,模型作者无需再写定制移植。

来源:Hugging Face Blog · huggingface.co