Ollama 模型体积 2026:每个模型到底需要多少内存
下载了模型然后机器卡死?模型文件体积 vs 内存——这是防止交换地狱的数学。
💡 你将学到
下载了模型然后机器卡死?模型文件体积 vs 内存——这是防止交换地狱的数学。
交换地狱螺旋
你在 16GB 机器上拉了个 40GB 模型,操作系统开始交换,一切卡死——经典本地 LLM 失败。解法是简单预算:模型文件体积 + 运行时开销必须装进内存/显存,还要给系统和应用留余量。
体积数学
模型文件体积约等于:参数量 × 每权重位数 / 8。7B 模型 4 位量化约 4-5GB。8 位(约 fp16)翻倍。这就是量化的意义:q4 给你 4.9GB 的 Llama 8B 而不是 16GB。
实用预算
经验法则:机器需要 模型体积 + 1GB 开销,总内存最好有 2 倍余量(系统和浏览器还要内存)。
| 机器内存 | 安全最大模型 | 例子 |
|---|---|---|
| 8GB | 4-6GB 文件 | Gemma 2B、Qwen 7B q4 |
| 16GB | 7-10GB 文件 | Llama 8B、Qwen 14B q4 |
| 32GB | 16-24GB 文件 | Qwen 32B q4、Llama 70B q3 |
| 64GB | 35-48GB 文件 | Llama 70B q4、Qwen 72B q4 |
拉取前怎么查
# 不下载也能看模型文件体积
ollama show <model> --modelfile | head -20
# 或看库页面:显示的 size 就是 q4 文件
ollama list # 拉取后显示已装体积
显存 vs 系统内存
- GPU(显存):最快;速度要好整个模型应装进显存
- CPU(系统内存):慢但能用;Ollama 有 GPU 就卸载层过去
- 混合:Ollama 尽量把层放 GPU,其余 CPU——可用但更慢
真正有用的升级
- CPU 推理:加内存比加显存更有用;32GB 系统内存解锁 32B 模型
- 量化:q4_K_M 是质量/体积甜点位;内存宽裕用 q8
- 上下文长度:大上下文(32k+)成倍增加内存——小机器调小
FAQ
为什么我的电脑卡死? 模型加开销超过内存,操作系统交换到磁盘——很硬。减小模型或上下文。
q4 和 q8 质量差多少? q8 更接近全精度(质量更好、体积 2 倍);q4 是标准折中。
16GB 能跑 70B 吗? 只能重度量化(q2-q3)且慢——不推荐。
上下文长度影响内存吗? 影响——KV 缓存随上下文增长;小机器上 128k 上下文会 OOM。保持适度。
相关文章
2026-08-05
2026年免费在线AI OCR:PaddleOCR(8.7万星)、Tesseract、EasyOCR对比,从图片和PDF提取文字
2026-08-01
微软免费开源了一个 Linux 操作系统,没错!是微软出品
2026-08-13
2026 年在安卓上跑 LLM:5 种把本地模型装进手机的方法
