Text Generation Inference
Serving stack berbasis Rust dari HuggingFace dengan tensor parallelism dan streaming bawaan.
TGI adalah inference server matang yang menangani sharding lintas GPU, continuous batching, dan streaming token. Integrasinya erat dengan ekosistem HuggingFace — penting ketika model pilihan Anda hanya tersedia sebagai checkpoint HF.
Cocok untuk: Serving multi-GPU di ekosistem HuggingFace
Deployment: Bisa self-host