Linux本地部署大模型:从环境配置到跑起来

📘 AI教程 💬 🔥 Trending 发布者: leakey
Linux本地部署大模型:从环境配置到跑起来

🩺 摘要

在Linux服务器上部署大模型跟Windows不一样,驱动、CUDA、容器都要配。怎么一步步来?

📝 详情

Linux部署大模型的优势

Linux是部署大模型的第一选择——Docker支持好、CUDA驱动成熟、systemd管理服务方便。

完整部署流程

第一步:检查硬件

nvidia-smi  # 查看显卡和驱动
# GPU 0: RTX 4090 (24GB) | Driver: 550.120 | CUDA: 12.4

nvcc --version  # 查看CUDA版本
free -h         # 查看内存
nproc           # CPU核心数

最低配置:RTX 3060 12GB + 32GB内存,只能跑7B Q4。 推荐配置:RTX 4090 24GB + 64GB内存,可跑30B Q4或7B FP16。

第二步:安装Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# ollama version 0.5.3

ollama run qwen2.5:7b

第三步:部署API服务

# systemd服务配置
sudo tee /etc/systemd/system/ollama.service << 'EOF'
[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Restart=always
RestartSec=3
[Install]
WantedBy=default.target
EOF

sudo systemctl daemon-reload
sudo systemctl enable --now ollama

配置对比

显卡 内存 可跑模型 推理速度 总成本
RTX 3060 12GB 32GB 7B Q4 ~40 t/s ~2000元
RTX 3090 24GB 64GB 14B Q4 ~60 t/s ~7000元(二手)
RTX 4090 24GB 64GB 30B Q4 ~100 t/s ~18000元

Linux下部署大模型比Windows稳定得多,推荐长期运行服务用Linux + systemd。