Ollama Windows安装指南:10分钟在Windows上运行本地LLM
Ollama是在Windows上运行本地LLM最简单的方式。本指南涵盖安装、GPU加速、模型管理。
💡 你将学到
Ollama是在Windows上运行本地LLM最简单的方式。本指南涵盖安装、GPU加速、模型管理。
📜 目录
Ollama Windows 安装指南:10分钟搞定本地大模型
Ollama(GitHub 17.6万星标)让在 Windows 上运行本地大模型变得极其简单。
第一步:在 Windows 上安装 Ollama
从 ollama.com/download 下载官方 Windows 安装程序,运行即可。安装程序会自动将 Ollama 添加到系统 PATH 中。
安装完成后,验证一下:
ollama --version
第二步:启用 GPU 加速(NVIDIA)
Ollama 会自动通过 CUDA 检测 NVIDIA GPU。
不同模型大小的显存需求:
| 模型大小 | 所需 GPU 显存 | 推荐 GPU 示例 |
|---|---|---|
| 7B Q4 | 约5GB | RTX 3060 12GB、RTX 4060 |
| 13B Q4 | 约8GB | RTX 3070、RTX 4070 |
| 34B Q4 | 约20GB | RTX 3090、RTX 4090 |
| 70B Q4 | 约40GB | 双 RTX 3090、A6000 |
第三步:拉取并运行模型
ollama pull llama3.1:8b
ollama run llama3.1:8b
第四步:搭建 Open WebUI
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -e OLLAMA_BASE_URL=http://host.docker.internal:11434 -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
打开 http://localhost:3000 —— 一个由你的本地大模型驱动的 ChatGPT 克隆版。
第五步:连接 VS Code(Continue 扩展)
在 VS Code 中安装 Continue 扩展,然后在 config.json 中配置:
{
"models": [{
"title": "Ollama Local",
"provider": "ollama",
"model": "llama3.1:8b"
}]
}
Windows 性能基准测试
| GPU | 模型 | 每秒 Token 数 |
|---|---|---|
| RTX 4060 (8GB) | Llama 3.1 8B Q4 | 45-55 t/s |
| RTX 3090 (24GB) | Qwen3 14B Q4 | 35-45 t/s |
| 仅 CPU (i7-13700) | Llama 3.1 8B Q4 | 5-8 t/s |
常见问题排查
问题:新终端中找不到 Ollama 命令 运行 refreshenv 或重启终端。
问题:未检测到 GPU 从 NVIDIA 官网安装 CUDA 12.4 或更高版本。
问题:内存不足 使用更小的模型或 Q4 量化版本。
相关文章
相关文章
2026-07-16
Windows本地跑大模型完整指南:Ollama+Open WebUI+LM Studio三步搞定
2026-08-01
MCP服务器新手教程2026
2026-07-22
2026年AI智能体工具与技能对比
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
