llama.cpp
纯 C/C++ 的 LLM 推理引擎,CPU 优先、零依赖
Georgi Gerganov 开发的 LLM 推理引擎,纯 C/C++ 实现、零依赖,CPU 推理是核心场景。提供两个主要可执行文件:llama-cli 用于命令行对话,llama-server 启动 OpenAI 兼容 REST API 与内置 WebUI。模型统一使用 GGUF 格式,支持 1.5-bit 到 8-bit 量化以降低内存占用。后端覆盖 CPU(AVX/NEON/RVV)、GPU(CUDA/Metal/Vulkan/ROCm)及 CPU+GPU 混合推理。Ollama、LM Studio、GPT4All 等本地推理工具均在其引擎上构建。ggml-org 团队于 2026 年 2 月加入 HuggingFace。
社区实测
llama.cpp 是强大的底层推理引擎,适合有调参能力的用户精细优化,但多用户并发性能不佳,WebGUI 缺少模型管理功能。
- 允许用户针对特定硬件和模型编写配置文件进行精细优化
- 提供直接的 API 接口,任何客户端都能灵活调用
- 多用户并发时性能明显下降
- WebGUI 不支持动态加载/卸载模型,非技术用户使用不便
- VS Code 扩展会自行启动服务器,无法连接已有的终端实例
来源
r/LocalLLaMA: llama.cpp is all you needHacker News: llama.cppr/LocalLLaMA: llama.cpp appreciation postr/LocalLLaMA: benefit of llama.cpp vs LM Studio/Ollama
截至 2026-08-16
brew install llama.cpp winget install llama.cpp curl -LsSf https://llama.app/install.sh | sh docker run -v /path/to/models:/models -p 8080:8080 ghcr.io/ggml-org/llama.cpp:server -m /models/model.gguf --port 8080 --host 0.0.0.0