本地大模型Linux部署:在Ubuntu上运行7B到70B模型

📘 教程 2026-07-20 约 6 分钟阅读

Linux是运行本地LLM最好的操作系统。本指南涵盖在Ubuntu上安装Ollama、llama.cpp、CUDA等。

💡 你将学到

Linux是运行本地LLM最好的操作系统。本指南涵盖在Ubuntu上安装Ollama、llama.cpp、CUDA等。

📜 目录

本地大语言模型 Linux 搭建指南:在 Ubuntu 上运行 7B 至 70B 模型

Linux 是本地 LLM 推理的首选操作系统。GPU 驱动更优、内存开销更低,且能访问完整工具链。

第一步:安装 NVIDIA 驱动和 CUDA

# 检查 GPU
lspci | grep -i nvidia

# 添加 NVIDIA 驱动仓库
sudo add-apt-repository ppa:graphics-drivers/ppa
sudo apt update
sudo apt install nvidia-driver-550
sudo reboot

# 验证
nvidia-smi

第二步:安装 Ollama(最简单)

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama
ollama pull llama3.1:8b
ollama run llama3.1:8b "Hello!"

Ollama 会自动作为 systemd 服务运行。

第三步:安装 llama.cpp(高级用户)

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DLLAMA_CUDA=ON
cmake --build build --config Release -j

# 下载 GGUF 模型
pip install huggingface-hub
huggingface-cli download TheBloke/Qwen2.5-7B-Instruct-GGUF \
    qwen2.5-7b-instruct.Q4_K_M.gguf --local-dir ./models

# 运行
./build/bin/llama-cli -m ./models/qwen2.5-7b-instruct.Q4_K_M.gguf \
    -p "Hello" -n 128 -ngl 99

第四步:Docker 配置

curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER
newgrp docker

# NVIDIA Container Toolkit
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

# 在 Docker 中运行 Ollama 并启用 GPU
docker run -d --gpus all -v ollama_data:/root/.ollama \
    -p 11434:11434 --name ollama ollama/ollama

第五步:完整 AI 技术栈

# 一键安装所有组件
sudo apt install -y python3-pip python3-venv build-essential cmake git
curl -fsSL https://ollama.com/install.sh | sh
pip install torch transformers langchain chromadb sentence-transformers

# 拉取模型
ollama pull llama3.1:8b
ollama pull nomic-embed-text

性能对比:Linux vs Windows vs Mac

操作系统 7B Q4 速度 GPU 支持 内存开销
Linux (Ubuntu) 100%(基准) CUDA/ROCm/Metal ~1GB
Windows 95-98% CUDA/DirectML ~3GB
macOS 90-95% Metal (MPS) ~2GB
## 系统优化
echo 'vm.max_map_count=2147483642' | sudo tee -a /etc/sysctl.conf
sudo sysctl -p
sudo swapoff -a  # 防止内存抖动

常见问题

问:Ubuntu 22.04 还是 24.04? 答:24.04 LTS 对 GPU 驱动支持更好。 问:Ollama 开机自启? 答:通过 systemd 自动实现。 问:无显示器能用 CUDA 吗? 答:可以,NVIDIA 驱动支持无头模式。

相关文章

❓ 常见问题

Ubuntu 22.04 or 24.04?

24.04 LTS for better GPU driver support.

CUDA without a display?

Yes, NVIDIA drivers work headless.

相关文章
2026-07-19
DeepSeek R1本地部署:最强中文推理模型上手
2026-07-17
AI Agent请求去重:同一个问题别处理两次
2026-07-23
LLM评估指标与方法:2026年完整指南

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论