本地运行Ollama:所有必用命令

📘 教程 2026-08-01 · 更新于 2026-08-24 约 5 分钟阅读

本地运行Ollama命令大全:安装、拉取模型、对话、API服务、Modelfile自定义与管理,一张表查完。

💡 你将学到

本地运行Ollama命令大全:安装、拉取模型、对话、API服务、Modelfile自定义与管理,一张表查完。

📜 目录

本地运行Ollama:所有必用命令

Ollama(GitHub 177k+ 星)是2026年最简单的本地LLM运行方式:一条命令下载模型,一条命令开始对话,还能起一个兼容OpenAI格式的API服务。本文把安装到进阶的全部命令整理成一份能查能抄的参考。

一、安装:三个平台都是一条命令

装完先验证:ollama --version

二、模型管理:pull / list / rm / cp

命令 作用 示例
ollama pull 下载模型 ollama pull qwen2.5:7b
ollama list 查看已下载 ollama list
ollama rm 删除模型 ollama rm qwen2.5:7b
ollama cp 克隆模型(改名) ollama cp qwen2.5:7b my-qwen

模型命名规则是 名称:标签(如 qwen2.5:7b),不带标签会拉默认版本。

三、对话:run 与快捷键

ollama run qwen2.5:7b

进入对话后: - /bye 退出 - /help 看全部快捷键 - /set parameter num_ctx 8192 临时调大上下文 - 直接输问题就是正常对话,支持多轮

不想进交互界面,可以一条命令直接问:ollama run qwen2.5:7b "用一句话解释什么是RAG"

四、API 服务:serve 与 OpenAI 兼容端点

ollama serve 启动服务,默认监听 11434 端口,提供 OpenAI 兼容的 /v1/chat/completions 端点——代码里把 base_url 改成 http://localhost:11434/v1 就能用:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'

原生 API 是 /api/generate(一次性生成)和 /api/chat(多轮)。ollama ps 查看当前哪些模型在内存里。

常用工作流:三个真实组合

五、Modelfile:create 自定义模型

Modelfile 是 Ollama 的"配方文件",用来定制模型行为。最简单的例子:

FROM qwen2.5:7b
SYSTEM "你是一位严谨的中文技术编辑。"

保存为 Modelfile 后执行 ollama create my-editor -f Modelfile,然后 ollama run my-editor 就是带系统提示词的定制模型。常用指令还有 PARAMETER temperature 0.3(降随机性)、PARAMETER num_ctx 8192(扩上下文)。

六、环境变量与常用参数

变量/参数 默认 作用
OLLAMA_KEEP_ALIVE 5m 模型在内存驻留时间(-1=常驻),改小省内存
OLLAMA_MODELS ~/.ollama/models 模型存放目录,可指向大硬盘
OLLAMA_HOST 127.0.0.1:11434 监听地址,局域网共享改成 0.0.0.0:11434
num_ctx 2048~4096 上下文窗口,长文档要调大
temperature 0.8 越高越随机,越低越稳定
num_predict -1 最大输出 token 数,-1 不限

常见问题

Q:没有 GPU 能跑吗? A:能。纯 CPU 跑 7B 约 2-5 token/s,日常问答可用;GPU 快 5-20 倍,建议 8GB 显存跑 7B 量化版。

Q:长文档被截断? A:启动时指定 ollama run qwen2.5:7b --num-ctx 8192,或在 Modelfile 里写 PARAMETER num_ctx 8192。注意上下文越大越吃内存。

Q:模型下载太慢? A:Ollama 默认从官方源拉取,国内可配置镜像源(官方文档有说明),或手动下载 GGUF 后用 Modelfile 导入。

注:模型标签、版本号随官方更新变化,具体以 Ollama 官方文档和模型页为准。

相关文章

❓ 常见问题

Does Ollama need a GPU?

No - it runs on CPU, but GPU (CUDA/Metal) gives 5-20x speedup.

Is the API OpenAI-compatible?

Yes, the /v1/chat/completions endpoint works with most tools that expect OpenAI.

相关文章
2026-07-27
ComfyUI工作流教程
2026-08-13
开源 AI 有声书生成器 2026:自托管 TTS 朗读你的书库
2026-08-11
上下文工程2026:取代提示工程成为Agent核心的学科

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论