本地大模型Linux部署:在Ubuntu上运行7B到70B模型
Linux是运行本地LLM最好的操作系统。本指南涵盖在Ubuntu上安装Ollama、llama.cpp、CUDA等。
💡 你将学到
Linux是运行本地LLM最好的操作系统。本指南涵盖在Ubuntu上安装Ollama、llama.cpp、CUDA等。
📜 目录
本地大语言模型 Linux 搭建指南:在 Ubuntu 上运行 7B 至 70B 模型
Linux 是本地 LLM 推理的首选操作系统。GPU 驱动更优、内存开销更低,且能访问完整工具链。
第一步:安装 NVIDIA 驱动和 CUDA
# 检查 GPU
lspci | grep -i nvidia
# 添加 NVIDIA 驱动仓库
sudo add-apt-repository ppa:graphics-drivers/ppa
sudo apt update
sudo apt install nvidia-driver-550
sudo reboot
# 验证
nvidia-smi
第二步:安装 Ollama(最简单)
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama
ollama pull llama3.1:8b
ollama run llama3.1:8b "Hello!"
Ollama 会自动作为 systemd 服务运行。
第三步:安装 llama.cpp(高级用户)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DLLAMA_CUDA=ON
cmake --build build --config Release -j
# 下载 GGUF 模型
pip install huggingface-hub
huggingface-cli download TheBloke/Qwen2.5-7B-Instruct-GGUF \
qwen2.5-7b-instruct.Q4_K_M.gguf --local-dir ./models
# 运行
./build/bin/llama-cli -m ./models/qwen2.5-7b-instruct.Q4_K_M.gguf \
-p "Hello" -n 128 -ngl 99
第四步:Docker 配置
curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER
newgrp docker
# NVIDIA Container Toolkit
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
# 在 Docker 中运行 Ollama 并启用 GPU
docker run -d --gpus all -v ollama_data:/root/.ollama \
-p 11434:11434 --name ollama ollama/ollama
第五步:完整 AI 技术栈
# 一键安装所有组件
sudo apt install -y python3-pip python3-venv build-essential cmake git
curl -fsSL https://ollama.com/install.sh | sh
pip install torch transformers langchain chromadb sentence-transformers
# 拉取模型
ollama pull llama3.1:8b
ollama pull nomic-embed-text
性能对比:Linux vs Windows vs Mac
| 操作系统 | 7B Q4 速度 | GPU 支持 | 内存开销 |
|---|---|---|---|
| Linux (Ubuntu) | 100%(基准) | CUDA/ROCm/Metal | ~1GB |
| Windows | 95-98% | CUDA/DirectML | ~3GB |
| macOS | 90-95% | Metal (MPS) | ~2GB |
| ## 系统优化 |
echo 'vm.max_map_count=2147483642' | sudo tee -a /etc/sysctl.conf
sudo sysctl -p
sudo swapoff -a # 防止内存抖动
常见问题
问:Ubuntu 22.04 还是 24.04? 答:24.04 LTS 对 GPU 驱动支持更好。 问:Ollama 开机自启? 答:通过 systemd 自动实现。 问:无显示器能用 CUDA 吗? 答:可以,NVIDIA 驱动支持无头模式。
相关文章
❓ 常见问题
Ubuntu 22.04 or 24.04?
24.04 LTS for better GPU driver support.
CUDA without a display?
Yes, NVIDIA drivers work headless.
相关文章
2026-07-19
DeepSeek R1本地部署:最强中文推理模型上手
2026-07-17
AI Agent请求去重:同一个问题别处理两次
2026-07-23
LLM评估指标与方法:2026年完整指南
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
