2026年本地运行Llama:llama.cpp(12.3万星)完整指南,从下载GGUF到任意硬件上聊天
llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。
💡 你将学到
llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。
直接给结论
llama.cpp(122,773星,MIT)是Llama级模型的C/C++参考运行时。它的超能力是量化:转成GGUF格式的4位模型,能跑在永远装不下原始FP16权重的机器上。
第一步 - 获取llama.cpp
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON # NVIDIA GPU加这个
cmake --build build --config Release -j
纯CPU:跳过CUDA参数。macOS:开箱即用Metal。
第二步 - 下载GGUF模型
# 示例:Llama 3.1 8B,4位量化(来自Hugging Face)
wget https://huggingface.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF/resolve/main/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf
第三步 - 聊天
./build/bin/llama-cli -m Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf -p "Explain quantum computing simply" -n 256
理解量化
| 量化 | 位/权重 | 体积(8B) | 质量 |
|---|---|---|---|
| Q8_0 | 8 | ~8.5GB | 接近无损 |
| Q4_K_M | 4.5 | ~4.9GB | 推荐 |
| Q3_K_M | 3.5 | ~4.0GB | 明显下降 |
| Q2_K | 2.5 | ~3.1GB | 仅供测试 |
真实数据
- Q4_K_M是社区默认:8B模型约4.9GB,8GB内存机器能跑。
- M1/M2 Mac上8B Q4约20-30 token/秒。4090上100+ token/秒。
- 树莓派5能跑3-4B模型,速度可用(约5-10 token/秒)。
FAQ
Q:GGUF是什么? A:存量化权重+元数据的文件格式,由llama.cpp项目设计。
Q:内存该配多大模型? A:经验法则:选约等于你空闲内存一半的量化模型。8GB内存-4B模型;16GB-8B;32GB-13-14B。
Q:能用GPU吗? A:能——支持CUDA、ROCm、Metal和Vulkan后端。用-ngl 99把所有层卸载到GPU。
相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf
