在macOS上运行Ollama:Apple Silicon完整指南

📘 教程 2026-08-01 · 更新于 2026-08-28 约 1 分钟阅读

在macOS上运行Ollama:Apple Silicon完整指南

💡 你将学到

在macOS上运行Ollama:Apple Silicon完整指南

📜 目录

在macOS上运行Ollama:Apple Silicon完整指南

想在自己电脑上跑大模型,又不想折腾显卡驱动,Apple Silicon的Mac是2026年最省心的选择。统一内存的设计让"内存就是显存",一台16GB内存的MacBook就能流畅跑7B模型,64GB以上的机型甚至能本地跑70B量化模型。这篇从安装到选模型,把在Mac上跑Ollama的完整流程讲清楚。

一、安装Ollama:两条路任选

方式A:命令行安装(推荐)

打开终端,执行一行命令:

curl -fsSL https://ollama.com/install.sh | sh

脚本会自动安装并配置好环境,装完直接能用。

方式B:图形界面安装

去官网下载Ollama.app,拖进应用程序文件夹即可。这个版本会在菜单栏常驻一个小图标,可以一键启动、停止服务,还带模型管理界面,适合不习惯命令行的用户。

装完后验证一下:

ollama --version

能看到版本号就说明安装成功。

二、确认Metal加速生效

Ollama在Apple Silicon上默认走Metal(苹果的GPU加速框架)。跑一个模型确认加速真的生效了:

ollama run llama3.2:3b --verbose

在输出的设备信息里找到 Metal 字样,就说明GPU加速在工作。如果只显示CPU,检查一下是不是装成了Intel版,或者系统没识别到GPU。

三、按内存选模型:一张表搞定

Mac上选模型只有一个硬约束:内存大小。模型越大越聪明,但跑不起来等于零。按内存档位推荐:

内存 推荐模型 体验
8GB qwen3:4b、llama3.2:3b 流畅,能聊天、能写简单代码
16GB qwen3:7b、mistral:7b 甜点区,15-30 token/秒,日常够用
32GB+ qwen3:14b、llama3.1:8b 质量明显提升,复杂任务也能扛
64GB+ 70B Q4量化版 10-20 token/秒,接近云端旗舰体验

拉取模型只需要一条命令:

ollama pull qwen3:7b

然后就能对话了:

ollama run qwen3:7b

四、实测速度:不同机型的真实水平

速度取决于芯片和内存,社区2026年的实测数据大致如下(Q4量化、上下文默认配置):

机型 模型 速度
M1/M2 16GB 7B Q4 约15-20 token/秒
M2 Pro/Max 7B Q4 约25-35 token/秒
M2 Pro/Max 13B Q4 约15-20 token/秒
M4 Max 128GB 70B Q4 约15-25 token/秒

注意:这些数字是社区实测的平均水平,具体速度受上下文长度、后台进程影响。跑重型任务时如果明显变慢,先看看是不是后台有别的程序占内存。

五、常用命令速查

命令 作用
ollama list 查看本地已下载的模型
ollama pull 模型名 下载模型
ollama run 模型名 启动模型对话
ollama ps 查看当前加载的模型和显存占用
ollama stop 模型名 卸载当前模型,释放内存
ollama rm 模型名 删除模型文件
ollama show 模型名 查看模型详情(参数、量化档位)

这7条命令覆盖日常使用的大部分场景。忘参数也没关系,ollama --help 随时能看到完整说明。

六、让Ollama更好用的4个技巧

  1. 推理时关掉其他大应用。统一内存是共享的,浏览器开几十个标签页会挤占模型的内存,速度直接腰斩。
  2. 用Ollama.app常驻后台。菜单栏版可以开机自启,模型保持热加载,对话不用等启动。
  3. 设置OLLAMA_KEEP_ALIVE。默认模型闲置5分钟后卸载,交互式使用可以调大,省去反复加载的时间:
export OLLAMA_KEEP_ALIVE=3600
  1. API兼容OpenAI格式。Ollama自带API服务(默认11434端口),任何兼容OpenAI接口的客户端都能直接连,写代码调用非常方便。

常见问题

Q:Mac上Ollama用GPU吗? A:用。Apple Silicon上Metal加速是自动开启的,不需要额外配置,这也是Mac跑本地模型省心的原因。

Q:Intel芯片的Mac能跑吗? A:能,但速度只有Apple Silicon的三分之一到五分之一,跑7B模型会比较吃力。想认真玩本地模型,还是建议Apple Silicon机型。

Q:显存不够怎么办? A:Mac没有独立显存,靠的是统一内存。内存不够就换小模型,或者用量化程度更高的版本。Ollama还支持把部分层放到内存里跑,慢一点但能跑起来。

Q:模型文件占多大空间? A:7B Q4量化版约4-5GB,70B Q4约40GB左右。下载前先看看硬盘剩余空间,具体大小以模型页面标注为准。

Q:和LM Studio比哪个好? A:两者底层都能跑本地模型。Ollama命令行友好、API标准、适合开发;LM Studio图形界面更直观、适合纯聊天用户。可以都装上试试,模型文件不冲突。

相关文章

❓ 常见问题

Does Ollama use the GPU on Mac?

Yes, Metal acceleration is automatic on Apple Silicon.

What about Intel Macs?

They work but are 3-5x slower - Apple Silicon is strongly recommended for LLMs.

相关文章
2026-07-19
Function Calling指南:让AI学会调用你的API
2026-07-27
Runway Gen-3教程
2026-08-05
2026年Python AI代理:LangChain(14.3万星)对比 CrewAI 与 AutoGen,今天搭出第一个代理

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论