Deployment & Inference ★ 62.0k

vLLM

Mesin inferensi LLM throughput tinggi dengan PagedAttention — pilihan utama saat Anda perlu memeras GPU.

vLLM menyajikan model open-source dengan continuous batching dan PagedAttention, menghasilkan throughput beberapa kali lipat dibanding pipeline HuggingFace biasa di kartu yang sama. API-nya kompatibel dengan OpenAI, jadi menggantinya di aplikasi yang sudah ada biasanya cukup mengubah satu baris base-url.

Cocok untuk: Inferensi produksi self-host di GPU NVIDIA/AMD

Deployment: Bisa self-host