本地运行Ollama:所有必用命令
本地运行Ollama命令大全:安装、拉取模型、对话、API服务、Modelfile自定义与管理,一张表查完。
💡 你将学到
本地运行Ollama命令大全:安装、拉取模型、对话、API服务、Modelfile自定义与管理,一张表查完。
📜 目录
本地运行Ollama:所有必用命令
Ollama(GitHub 177k+ 星)是2026年最简单的本地LLM运行方式:一条命令下载模型,一条命令开始对话,还能起一个兼容OpenAI格式的API服务。本文把安装到进阶的全部命令整理成一份能查能抄的参考。
一、安装:三个平台都是一条命令
- macOS / Linux:
curl -fsSL https://ollama.com/install.sh | sh - Windows:去 ollama.com 下载安装包,装完在 PowerShell 里就能用
ollama - Docker(想隔离环境或跑服务端):
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
装完先验证:ollama --version。
二、模型管理:pull / list / rm / cp
| 命令 | 作用 | 示例 |
|---|---|---|
| ollama pull | 下载模型 | ollama pull qwen2.5:7b |
| ollama list | 查看已下载 | ollama list |
| ollama rm | 删除模型 | ollama rm qwen2.5:7b |
| ollama cp | 克隆模型(改名) | ollama cp qwen2.5:7b my-qwen |
模型命名规则是 名称:标签(如 qwen2.5:7b),不带标签会拉默认版本。
三、对话:run 与快捷键
ollama run qwen2.5:7b
进入对话后:
- /bye 退出
- /help 看全部快捷键
- /set parameter num_ctx 8192 临时调大上下文
- 直接输问题就是正常对话,支持多轮
不想进交互界面,可以一条命令直接问:ollama run qwen2.5:7b "用一句话解释什么是RAG"。
四、API 服务:serve 与 OpenAI 兼容端点
ollama serve 启动服务,默认监听 11434 端口,提供 OpenAI 兼容的 /v1/chat/completions 端点——代码里把 base_url 改成 http://localhost:11434/v1 就能用:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'
原生 API 是 /api/generate(一次性生成)和 /api/chat(多轮)。ollama ps 查看当前哪些模型在内存里。
常用工作流:三个真实组合
- 本地问答助手:
pull一个 7B 模型 →run直接聊;要图形界面就serve后接 OpenAI 兼容客户端 - 接入自己的应用:
serve起服务 → 代码里 base_url 指向 11434 → 应用立刻获得本地推理能力 - 多模型按任务切换:
pull多个模型 → 按任务换 model 名,小任务用 3B 省钱提速,复杂推理用 7B
五、Modelfile:create 自定义模型
Modelfile 是 Ollama 的"配方文件",用来定制模型行为。最简单的例子:
FROM qwen2.5:7b
SYSTEM "你是一位严谨的中文技术编辑。"
保存为 Modelfile 后执行 ollama create my-editor -f Modelfile,然后 ollama run my-editor 就是带系统提示词的定制模型。常用指令还有 PARAMETER temperature 0.3(降随机性)、PARAMETER num_ctx 8192(扩上下文)。
六、环境变量与常用参数
| 变量/参数 | 默认 | 作用 |
|---|---|---|
| OLLAMA_KEEP_ALIVE | 5m | 模型在内存驻留时间(-1=常驻),改小省内存 |
| OLLAMA_MODELS | ~/.ollama/models | 模型存放目录,可指向大硬盘 |
| OLLAMA_HOST | 127.0.0.1:11434 | 监听地址,局域网共享改成 0.0.0.0:11434 |
| num_ctx | 2048~4096 | 上下文窗口,长文档要调大 |
| temperature | 0.8 | 越高越随机,越低越稳定 |
| num_predict | -1 | 最大输出 token 数,-1 不限 |
常见问题
Q:没有 GPU 能跑吗? A:能。纯 CPU 跑 7B 约 2-5 token/s,日常问答可用;GPU 快 5-20 倍,建议 8GB 显存跑 7B 量化版。
Q:长文档被截断?
A:启动时指定 ollama run qwen2.5:7b --num-ctx 8192,或在 Modelfile 里写 PARAMETER num_ctx 8192。注意上下文越大越吃内存。
Q:模型下载太慢? A:Ollama 默认从官方源拉取,国内可配置镜像源(官方文档有说明),或手动下载 GGUF 后用 Modelfile 导入。
注:模型标签、版本号随官方更新变化,具体以 Ollama 官方文档和模型页为准。
相关文章
❓ 常见问题
Does Ollama need a GPU?
No - it runs on CPU, but GPU (CUDA/Metal) gives 5-20x speedup.
Is the API OpenAI-compatible?
Yes, the /v1/chat/completions endpoint works with most tools that expect OpenAI.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
