跳到正文
原文
Hugging Face Blog·· 2026-07-08

Hugging Face 让 vLLM 的 transformers 建模后端达到原生速度

Native-speed vLLM transformers modeling backend

SI 导读

Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现的吞吐。该后端通过 torch.fx 做静态图分析、用 ast 重写源码,在运行时动态应用推理相关的层融合,从而匹配自定义实现的性能,并可与张量并行、数据并行、专家并行等常规配置组合。

精选SI 评分62
推荐理由

原文给出了 transformers 后端在 vLLM 中追平原生实现的具体做法与启用方式,读者可据此判断现有部署是否需要改动。

来源:Hugging Face Blog · huggingface.co

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有