vLLM transformers 建模后端提速,性能追平甚至超越原生实现
Hugging Face 宣布 vLLM 的 transformers 建模后端经过优化后,在 Qwen3-4B 单卡、Qwen3-32B 张量并行和 Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,吞吐量均达到或超过 vLLM 手写原生实现。
推荐理由:原文给出了 transformers 后端在多种并行配置下达到或超过原生 vLLM 性能的实测结果,读者可据此评估统一建模代码与推理性能之间的取舍。