2026年本地运行Llama:llama.cpp(12.3万星)完整指南,从下载GGUF到任意硬件上聊天

📘 教程 2026-08-05 约 4 分钟阅读

llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。

💡 你将学到

llama.cpp(122,773星,MIT)几乎能在任何设备上跑Llama级模型——笔记本、树莓派、手机。本指南覆盖GGUF格式、量化等级、CPU/GPU编译和聊天CLI。

直接给结论

llama.cpp(122,773星,MIT)是Llama级模型的C/C++参考运行时。它的超能力是量化:转成GGUF格式的4位模型,能跑在永远装不下原始FP16权重的机器上。

第一步 - 获取llama.cpp

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON   # NVIDIA GPU加这个
cmake --build build --config Release -j

纯CPU:跳过CUDA参数。macOS:开箱即用Metal。

第二步 - 下载GGUF模型

# 示例:Llama 3.1 8B,4位量化(来自Hugging Face)
wget https://huggingface.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF/resolve/main/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf

第三步 - 聊天

./build/bin/llama-cli -m Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf -p "Explain quantum computing simply" -n 256

理解量化

量化 位/权重 体积(8B) 质量
Q8_0 8 ~8.5GB 接近无损
Q4_K_M 4.5 ~4.9GB 推荐
Q3_K_M 3.5 ~4.0GB 明显下降
Q2_K 2.5 ~3.1GB 仅供测试

真实数据

FAQ

Q:GGUF是什么? A:存量化权重+元数据的文件格式,由llama.cpp项目设计。

Q:内存该配多大模型? A:经验法则:选约等于你空闲内存一半的量化模型。8GB内存-4B模型;16GB-8B;32GB-13-14B。

Q:能用GPU吗? A:能——支持CUDA、ROCm、Metal和Vulkan后端。用-ngl 99把所有层卸载到GPU。

相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论