部署与推理 ★ 12.0k

Text Generation Inference

HuggingFace 用 Rust 写的推理服务栈,内置张量并行与流式输出。

TGI 是成熟的推理服务器,支持多卡张量并行、连续批处理与逐 token 流式返回。它和 HuggingFace 生态结合紧密——当你选中的模型只有一个 HF checkpoint 时,这点很关键。

适合场景:HuggingFace 生态内的多卡推理服务

部署方式:可自托管