Linux本地部署大模型:从环境配置到跑起来
🩺 摘要
在Linux服务器上部署大模型跟Windows不一样,驱动、CUDA、容器都要配。怎么一步步来?
📝 详情
Linux部署大模型的优势
Linux是部署大模型的第一选择——Docker支持好、CUDA驱动成熟、systemd管理服务方便。
完整部署流程
第一步:检查硬件
nvidia-smi # 查看显卡和驱动
# GPU 0: RTX 4090 (24GB) | Driver: 550.120 | CUDA: 12.4
nvcc --version # 查看CUDA版本
free -h # 查看内存
nproc # CPU核心数
最低配置:RTX 3060 12GB + 32GB内存,只能跑7B Q4。 推荐配置:RTX 4090 24GB + 64GB内存,可跑30B Q4或7B FP16。
第二步:安装Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# ollama version 0.5.3
ollama run qwen2.5:7b
第三步:部署API服务
# systemd服务配置
sudo tee /etc/systemd/system/ollama.service << 'EOF'
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Restart=always
RestartSec=3
[Install]
WantedBy=default.target
EOF
sudo systemctl daemon-reload
sudo systemctl enable --now ollama
配置对比
| 显卡 | 内存 | 可跑模型 | 推理速度 | 总成本 |
|---|---|---|---|---|
| RTX 3060 12GB | 32GB | 7B Q4 | ~40 t/s | ~2000元 |
| RTX 3090 24GB | 64GB | 14B Q4 | ~60 t/s | ~7000元(二手) |
| RTX 4090 24GB | 64GB | 30B Q4 | ~100 t/s | ~18000元 |
Linux下部署大模型比Windows稳定得多,推荐长期运行服务用Linux + systemd。
💬 评论 (0)