C/C++ 实现的大模型本地推理引擎,量化后可在消费级 CPU/GPU 上运行,是最流行的本地部署方案。
Project story
llama.cpp 用纯 C/C++ 重写了 LLM 推理内核,去掉了重型依赖,配合 GGUF 量化格式可以把模型压缩到显存友好的体积,在普通笔记本甚至树莓派上都能跑。它是 Ollama、LM Studio 等本地推理工具的底层引擎。
支持 Llama、Qwen、Gemma、DeepSeek 等几乎所有主流开源模型,提供命令行、HTTP Server、绑定库(Python/Node)多种使用方式,还可接 GPU 加速。
适合场景:追求数据隐私的本地使用、离线环境的模型服务、以及硬件有限想体验开源模型的用户。
上手方式:从 Hugging Face 下载 GGUF 模型文件,./main -m model.gguf 一行命令即可对话。