部署与推理 ★ 87.0k

llama.cpp

纯 C/C++ 的推理实现,优先面向 CPU——GPU 去不了的地方它能去。

llama.cpp 是多数 CPU 与边缘端大模型部署背后的引擎,配套的 GGUF 量化能把模型压到普通硬件也能跑。吞吐不如 GPU 方案,但部署限制少得多。

适合场景:纯 CPU、边缘与嵌入式推理

部署方式:可自托管