部署与推理 ★ 62.0k

vLLM

基于 PagedAttention 的高吞吐推理引擎——要在同一张卡上压出更多吞吐,通常就是它。

vLLM 用连续批处理与 PagedAttention 服务开源模型,在同一张卡上的吞吐通常是直接用 HuggingFace pipeline 的数倍。它提供兼容 OpenAI 的接口,接入既有应用基本只需要改一行 base_url。

适合场景:NVIDIA / AMD 显卡上的自托管生产推理

部署方式:可自托管