部署与推理 ★ 87.0k llama.cpp 纯 C/C++ 的推理实现,优先面向 CPU——GPU 去不了的地方它能去。 访问官网 → llama.cpp 是多数 CPU 与边缘端大模型部署背后的引擎,配套的 GGUF 量化能把模型压到普通硬件也能跑。吞吐不如 GPU 方案,但部署限制少得多。 适合场景:纯 CPU、边缘与嵌入式推理 部署方式:可自托管 #推理服务 #量化 #私有化部署 #开源