2026年Linux本地大模型部署:Ollama(17.8万星)安装指南,GPU、Docker、systemd完整走一遍
Ollama(177,825星)让Linux本地大模型变得很简单:一个安装脚本、GPU或CPU都行、自带systemd服务。本指南覆盖安装、拉模型、GPU检查、Docker和API用法。
💡 你将学到
Ollama(177,825星)让Linux本地大模型变得很简单:一个安装脚本、GPU或CPU都行、自带systemd服务。本指南覆盖安装、拉模型、GPU检查、Docker和API用法。
直接给结论
在Linux上,Ollama(177,825星,MIT)是本地大模型最快的路径:一条命令安装、下载即注册为systemd服务、API兼容OpenAI所以任何工具都能接。7-8B模型CPU能跑(慢),消费级GPU很快。
第一步 - 安装
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama # 应显示 active (running)
第二步 - 验证GPU(可选)
ollama ps # 显示已加载模型 + GPU占用
nvidia-smi # 确认NVIDIA驱动识别到显卡
Ollama通过CUDA自动识别NVIDIA显卡。AMD用户需要ROCm配置;纯CPU开箱即用。
第三步 - 拉取并运行模型
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Explain Linux permissions in one paragraph"
第四步 - Docker方式
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
第五步 - 使用API
curl http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b","prompt":"hi"}'
任意OpenAI兼容客户端也能指向http://localhost:11434/v1。
真实数据
- Ollama是GitHub上星数最高的本地大模型工具(177,825星),模型从0.5B到70B+。
- 7-8B Q4量化模型约需6GB内存;13B约9GB;70B约40GB。
- 7B模型在RTX 3060(12GB)上:约40-60 token/秒。纯CPU:约5-10 token/秒。
FAQ
Q:从哪个模型开始? A:qwen2.5:7b或llama3.1:8b——8GB+机器上质量/体积比最佳。
Q:怎么卸载? A:sudo systemctl stop ollama,然后删/usr/local/bin/ollama和~/.ollama。
Q:能多人共用吗? A:能——以systemd服务跑在localhost;对外暴露要小心(绑定0.0.0.0时要加认证)。
相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf
