Ollama 模型清单 2026:30+ 个模型附真实体积详解
你到底该拉哪个 Ollama 模型?这份清单覆盖大家真正在用的,含体积和诚实用例。
💡 你将学到
你到底该拉哪个 Ollama 模型?这份清单覆盖大家真正在用的,含体积和诚实用例。
模型动物园问题
Ollama(178,451 stars,2026-08-14)让本地跑 LLM 变成一条命令,但模型库巨大,命名(q4_K_M、7b、14b)让新手困惑。经久不衰的经验法则:越大越聪明、越小越快——你的内存决定天花板。
大家真正在用的模型
Llama 3.1 / 3.3(8B、70B):Meta 的通才。8B 适配 8GB+ 内存,覆盖多数日常任务;70B 需约 48GB,是本地质量天花板。好的默认选择。
Qwen 2.5(7B、14B、32B、72B):多语言全能选手,工具调用强。7B 是小模型编程最佳;32B 在 24GB GPU 上是甜点位。中英文都出色。
DeepSeek-R1(7B-671B 变体):推理专家:展示思维链。本地版(蒸馏 7B/14B/32B)在中端硬件上给你“思考”行为——更慢但逻辑题更好。
Gemma 2 / 3(2B、9B、27B):Google 的高效模型。2B 能在手机级设备跑;9B 是扎实的轻量之选。
Mistral(7B)/ Mixtral(8x7B):欧洲经典;指令遵循强。
Phi-4(14B):微软的紧凑推理模型;数学上超常发挥。
Command R(35B、104B):Cohere 的企业之选,长上下文和 RAG 聚焦。
gpt-oss(20B、120B):OpenAI 的开放权重线:20B 在同尺寸里出奇地强。
查看和管理模型
ollama list # 已安装模型
ollama pull llama3.3 # 下载
ollama run llama3.3 # 聊天
ollama show llama3.3 --modelfile # 配置
ollama rm llama3.3 # 删除
内存数学(约数)
| 模型 | 体积 | 所需内存 |
|---|---|---|
| Gemma 2B | 1.6GB | 4GB |
| Qwen 7B | 4.7GB | 8GB |
| Llama 8B | 4.9GB | 8GB |
| Phi-4 14B | 9GB | 16GB |
| Qwen 32B | 19GB | 32GB |
| Llama 70B | 40GB | 64GB |
按用途选
- 日常聊天:Llama 3.3 8B 或 Qwen 2.5 7B
- 编程:Qwen 2.5 Coder 7B/32B
- 推理谜题:DeepSeek-R1 蒸馏版
- 小机器:Gemma 2B
- 大硬件上的最佳质量:Llama 70B 或 Qwen 72B
FAQ
怎么知道我的内存上限? 模型文件体积必须能装进内存/显存;运行时再加约 1GB 开销。
q4_K_M 是什么意思? 量化级别——q4 每个权重约 4 位,牺牲一点质量换小得多的文件。
Mac 能跑吗? 能——Ollama 在 Apple Silicon 用 Metal;16GB M 系 Mac 流畅跑 8B 模型。
哪个模型中文最好? Qwen 2.5——中文训练充分,比 Llama 处理得好。
