在macOS上运行Ollama:Apple Silicon完整指南
在macOS上运行Ollama:Apple Silicon完整指南
💡 你将学到
在macOS上运行Ollama:Apple Silicon完整指南
📜 目录
在macOS上运行Ollama:Apple Silicon完整指南
想在自己电脑上跑大模型,又不想折腾显卡驱动,Apple Silicon的Mac是2026年最省心的选择。统一内存的设计让"内存就是显存",一台16GB内存的MacBook就能流畅跑7B模型,64GB以上的机型甚至能本地跑70B量化模型。这篇从安装到选模型,把在Mac上跑Ollama的完整流程讲清楚。
一、安装Ollama:两条路任选
方式A:命令行安装(推荐)
打开终端,执行一行命令:
curl -fsSL https://ollama.com/install.sh | sh
脚本会自动安装并配置好环境,装完直接能用。
方式B:图形界面安装
去官网下载Ollama.app,拖进应用程序文件夹即可。这个版本会在菜单栏常驻一个小图标,可以一键启动、停止服务,还带模型管理界面,适合不习惯命令行的用户。
装完后验证一下:
ollama --version
能看到版本号就说明安装成功。
二、确认Metal加速生效
Ollama在Apple Silicon上默认走Metal(苹果的GPU加速框架)。跑一个模型确认加速真的生效了:
ollama run llama3.2:3b --verbose
在输出的设备信息里找到 Metal 字样,就说明GPU加速在工作。如果只显示CPU,检查一下是不是装成了Intel版,或者系统没识别到GPU。
三、按内存选模型:一张表搞定
Mac上选模型只有一个硬约束:内存大小。模型越大越聪明,但跑不起来等于零。按内存档位推荐:
| 内存 | 推荐模型 | 体验 |
|---|---|---|
| 8GB | qwen3:4b、llama3.2:3b | 流畅,能聊天、能写简单代码 |
| 16GB | qwen3:7b、mistral:7b | 甜点区,15-30 token/秒,日常够用 |
| 32GB+ | qwen3:14b、llama3.1:8b | 质量明显提升,复杂任务也能扛 |
| 64GB+ | 70B Q4量化版 | 10-20 token/秒,接近云端旗舰体验 |
拉取模型只需要一条命令:
ollama pull qwen3:7b
然后就能对话了:
ollama run qwen3:7b
四、实测速度:不同机型的真实水平
速度取决于芯片和内存,社区2026年的实测数据大致如下(Q4量化、上下文默认配置):
| 机型 | 模型 | 速度 |
|---|---|---|
| M1/M2 16GB | 7B Q4 | 约15-20 token/秒 |
| M2 Pro/Max | 7B Q4 | 约25-35 token/秒 |
| M2 Pro/Max | 13B Q4 | 约15-20 token/秒 |
| M4 Max 128GB | 70B Q4 | 约15-25 token/秒 |
注意:这些数字是社区实测的平均水平,具体速度受上下文长度、后台进程影响。跑重型任务时如果明显变慢,先看看是不是后台有别的程序占内存。
五、常用命令速查
| 命令 | 作用 |
|---|---|
ollama list |
查看本地已下载的模型 |
ollama pull 模型名 |
下载模型 |
ollama run 模型名 |
启动模型对话 |
ollama ps |
查看当前加载的模型和显存占用 |
ollama stop 模型名 |
卸载当前模型,释放内存 |
ollama rm 模型名 |
删除模型文件 |
ollama show 模型名 |
查看模型详情(参数、量化档位) |
这7条命令覆盖日常使用的大部分场景。忘参数也没关系,ollama --help 随时能看到完整说明。
六、让Ollama更好用的4个技巧
- 推理时关掉其他大应用。统一内存是共享的,浏览器开几十个标签页会挤占模型的内存,速度直接腰斩。
- 用Ollama.app常驻后台。菜单栏版可以开机自启,模型保持热加载,对话不用等启动。
- 设置OLLAMA_KEEP_ALIVE。默认模型闲置5分钟后卸载,交互式使用可以调大,省去反复加载的时间:
export OLLAMA_KEEP_ALIVE=3600
- API兼容OpenAI格式。Ollama自带API服务(默认11434端口),任何兼容OpenAI接口的客户端都能直接连,写代码调用非常方便。
常见问题
Q:Mac上Ollama用GPU吗? A:用。Apple Silicon上Metal加速是自动开启的,不需要额外配置,这也是Mac跑本地模型省心的原因。
Q:Intel芯片的Mac能跑吗? A:能,但速度只有Apple Silicon的三分之一到五分之一,跑7B模型会比较吃力。想认真玩本地模型,还是建议Apple Silicon机型。
Q:显存不够怎么办? A:Mac没有独立显存,靠的是统一内存。内存不够就换小模型,或者用量化程度更高的版本。Ollama还支持把部分层放到内存里跑,慢一点但能跑起来。
Q:模型文件占多大空间? A:7B Q4量化版约4-5GB,70B Q4约40GB左右。下载前先看看硬盘剩余空间,具体大小以模型页面标注为准。
Q:和LM Studio比哪个好? A:两者底层都能跑本地模型。Ollama命令行友好、API标准、适合开发;LM Studio图形界面更直观、适合纯聊天用户。可以都装上试试,模型文件不冲突。
相关文章
❓ 常见问题
Does Ollama use the GPU on Mac?
Yes, Metal acceleration is automatic on Apple Silicon.
What about Intel Macs?
They work but are 3-5x slower - Apple Silicon is strongly recommended for LLMs.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
