Ollama 模型体积 2026:每个模型到底需要多少内存

📘 教程 2026-08-14 约 5 分钟阅读

下载了模型然后机器卡死?模型文件体积 vs 内存——这是防止交换地狱的数学。

💡 你将学到

下载了模型然后机器卡死?模型文件体积 vs 内存——这是防止交换地狱的数学。

📜 目录

交换地狱螺旋

你在 16GB 机器上拉了个 40GB 模型,操作系统开始交换,一切卡死——经典本地 LLM 失败。解法是简单预算:模型文件体积 + 运行时开销必须装进内存/显存,还要给系统和应用留余量。

体积数学

模型文件体积约等于:参数量 × 每权重位数 / 8。7B 模型 4 位量化约 4-5GB。8 位(约 fp16)翻倍。这就是量化的意义:q4 给你 4.9GB 的 Llama 8B 而不是 16GB。

实用预算

经验法则:机器需要 模型体积 + 1GB 开销,总内存最好有 2 倍余量(系统和浏览器还要内存)。

机器内存 安全最大模型 例子
8GB 4-6GB 文件 Gemma 2B、Qwen 7B q4
16GB 7-10GB 文件 Llama 8B、Qwen 14B q4
32GB 16-24GB 文件 Qwen 32B q4、Llama 70B q3
64GB 35-48GB 文件 Llama 70B q4、Qwen 72B q4

拉取前怎么查

# 不下载也能看模型文件体积
ollama show <model> --modelfile | head -20
# 或看库页面:显示的 size 就是 q4 文件
ollama list  # 拉取后显示已装体积

显存 vs 系统内存

真正有用的升级

FAQ

为什么我的电脑卡死? 模型加开销超过内存,操作系统交换到磁盘——很硬。减小模型或上下文。

q4 和 q8 质量差多少? q8 更接近全精度(质量更好、体积 2 倍);q4 是标准折中。

16GB 能跑 70B 吗? 只能重度量化(q2-q3)且慢——不推荐。

上下文长度影响内存吗? 影响——KV 缓存随上下文增长;小机器上 128k 上下文会 OOM。保持适度。

相关文章
2026-08-05
2026年免费在线AI OCR:PaddleOCR(8.7万星)、Tesseract、EasyOCR对比,从图片和PDF提取文字
2026-08-01
微软免费开源了一个 Linux 操作系统,没错!是微软出品
2026-08-13
2026 年在安卓上跑 LLM:5 种把本地模型装进手机的方法

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论