Ollama Windows安装指南:10分钟在Windows上运行本地LLM

📘 教程 2026-07-20 约 4 分钟阅读

Ollama是在Windows上运行本地LLM最简单的方式。本指南涵盖安装、GPU加速、模型管理。

💡 你将学到

Ollama是在Windows上运行本地LLM最简单的方式。本指南涵盖安装、GPU加速、模型管理。

📜 目录

Ollama Windows 安装指南:10分钟搞定本地大模型

Ollama(GitHub 17.6万星标)让在 Windows 上运行本地大模型变得极其简单。

第一步:在 Windows 上安装 Ollama

从 ollama.com/download 下载官方 Windows 安装程序,运行即可。安装程序会自动将 Ollama 添加到系统 PATH 中。

安装完成后,验证一下:

ollama --version

第二步:启用 GPU 加速(NVIDIA)

Ollama 会自动通过 CUDA 检测 NVIDIA GPU。

不同模型大小的显存需求:

模型大小 所需 GPU 显存 推荐 GPU 示例
7B Q4 约5GB RTX 3060 12GB、RTX 4060
13B Q4 约8GB RTX 3070、RTX 4070
34B Q4 约20GB RTX 3090、RTX 4090
70B Q4 约40GB 双 RTX 3090、A6000

第三步:拉取并运行模型

ollama pull llama3.1:8b
ollama run llama3.1:8b

第四步:搭建 Open WebUI

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -e OLLAMA_BASE_URL=http://host.docker.internal:11434 -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

打开 http://localhost:3000 —— 一个由你的本地大模型驱动的 ChatGPT 克隆版。

第五步:连接 VS Code(Continue 扩展)

在 VS Code 中安装 Continue 扩展,然后在 config.json 中配置:

{
  "models": [{
    "title": "Ollama Local",
    "provider": "ollama",
    "model": "llama3.1:8b"
  }]
}

Windows 性能基准测试

GPU 模型 每秒 Token 数
RTX 4060 (8GB) Llama 3.1 8B Q4 45-55 t/s
RTX 3090 (24GB) Qwen3 14B Q4 35-45 t/s
仅 CPU (i7-13700) Llama 3.1 8B Q4 5-8 t/s

常见问题排查

问题:新终端中找不到 Ollama 命令 运行 refreshenv 或重启终端。

问题:未检测到 GPU 从 NVIDIA 官网安装 CUDA 12.4 或更高版本。

问题:内存不足 使用更小的模型或 Q4 量化版本。

相关文章

相关文章
2026-07-16
Windows本地跑大模型完整指南:Ollama+Open WebUI+LM Studio三步搞定
2026-08-01
MCP服务器新手教程2026
2026-07-22
2026年AI智能体工具与技能对比

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论