2026年本地运行Llama:llama.cpp(12.3万星)完整指南,从下载GGUF到任意硬件上聊天
llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。
💡 你将学到
llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。
直接给结论
llama.cpp(122,773星,MIT)是Llama级模型的C/C++参考运行时。它的超能力是量化:转成GGUF格式的4位模型,能跑在永远装不下原始FP16权重的机器上。
第一步 - 获取llama.cpp
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON # NVIDIA GPU加这个
cmake --build build --config Release -j
纯CPU:跳过CUDA参数。macOS:开箱即用Metal。
第二步 - 下载GGUF模型
# 示例:Llama 3.1 8B,4位量化(来自Hugging Face)
wget https://huggingface.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF/resolve/main/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf
第三步 - 聊天
./build/bin/llama-cli -m Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf -p "Explain quantum computing simply" -n 256
理解量化
| 量化 | 位/权重 | 体积(8B) | 质量 |
|---|---|---|---|
| Q8_0 | 8 | ~8.5GB | 接近无损 |
| Q4_K_M | 4.5 | ~4.9GB | 推荐 |
| Q3_K_M | 3.5 | ~4.0GB | 明显下降 |
| Q2_K | 2.5 | ~3.1GB | 仅供测试 |
真实数据
- Q4_K_M是社区默认:8B模型约4.9GB,8GB内存机器能跑。
- M1/M2 Mac上8B Q4约20-30 token/秒。4090上100+ token/秒。
- 树莓派5能跑3-4B模型,速度可用(约5-10 token/秒)。
FAQ
Q:GGUF是什么? A:存量化权重+元数据的文件格式,由llama.cpp项目设计。
Q:内存该配多大模型? A:经验法则:选约等于你空闲内存一半的量化模型。8GB内存-4B模型;16GB-8B;32GB-13-14B。
Q:能用GPU吗? A:能——支持CUDA、ROCm、Metal和Vulkan后端。用-ngl 99把所有层卸载到GPU。
相关文章
❓ 常见问题
What is GGUF?
The file format that stores quantized model weights + metadata, designed by the llama.cpp project.
Which model size for my RAM?
Rule of thumb: pick a quantized model roughly half your free RAM. 8GB RAM - 4B models; 16GB - 8B; 32GB - 13-14B.
Can I use a GPU?
Yes - CUDA, ROCm, Metal and Vulkan backends are supported. Use `-ngl 99` to offload all layers to GPU.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
