树莓派5跑本地LLM:真实性能数据
树莓派5跑本地LLM:真实性能数据与完整搭建教程
💡 你将学到
树莓派5跑本地LLM:真实性能数据与完整搭建教程
树莓派5跑本地LLM:真实性能数据与完整搭建教程
树莓派5(8GB)可能是最便宜的常开LLM服务器:整机功耗约5-7瓦,一年电费不到一杯咖啡钱,可以7×24小时挂着当家庭AI服务。但它的性能天花板也很明确。这篇用社区实测数据把"能跑什么、跑多快、怎么装、值不值"一次讲清楚。
一、为什么用树莓派跑LLM
三个理由:
- 常开不心疼:功耗约5-7W,一年电费大约三五十元
- 数据不出家门:隐私文本(日记、健康数据、内部文档)本地处理,不经过任何云服务
- 当家庭智能中枢:局域网内的其他设备通过API调用它,相当于一个免费的推理后端
对应的代价是性能:它只能跑3B以下的小模型,速度远不如桌面显卡。
二、硬件怎么选
| 型号 | 内存 | 跑LLM建议 | 说明 |
|---|---|---|---|
| 树莓派5 8GB | 8GB | 推荐 | 1.5B流畅,3B勉强 |
| 树莓派5 4GB | 4GB | 不推荐 | 只能跑1B,意义不大 |
| 树莓派4 8GB | 8GB | 可用但慢 | 性能约为Pi 5的一半 |
| 树莓派Zero 2W | 1GB | 别想 | 跑不了 |
三个要点:只有8GB版值得跑LLM;建议配NVMe HAT固态硬盘(或至少高速TF卡),模型加载速度差距明显;散热片必装,推理时CPU会持续满载。
三、安装:三条命令
前提:Raspberry Pi OS 64位系统(arm64)。
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:1.5b
ollama run qwen2.5:1.5b
- 第一条安装Ollama(官方支持Linux arm64)
- 第二条下载模型(Q4量化版约1GB)
- 第三条进入交互对话
局域网调用:Ollama默认监听11434端口,把 OLLAMA_HOST=0.0.0.0:11434 写进systemd配置后,其他设备就能用 http://树莓派IP:11434 直接调用,等于一个免费本地API服务。
四、真实性能数据(社区实测)
| 模型 | 参数量 | 量化 | 实测速度 | 可用性 |
|---|---|---|---|---|
| Llama-3.2-1B | 1B | Q4 | 约12-16 token/s | 流畅 |
| Qwen2.5-1.5B | 1.5B | Q4 | 约10-14 token/s | 流畅 |
| Qwen2.5-3B | 3B | Q4 | 约5-8 token/s | 勉强可用 |
| Llama-3.2-3B | 3B | Q4 | 约4-6 token/s | 勉强 |
| 任意7B模型 | 7B | Q4 | 约1-3 token/s | 基本不可用 |
判断标准:对话场景至少8 token/s才有体验,批量任务可以更低。1.5B模型回答一个短句约1-2秒,日常够用。
五、提速与调优
- 加swap:跑3B模型时8GB内存紧张,扩4GB swap(dphys-swapfile配置)能防止进程被杀,但速度会掉
- 换NVMe:模型文件放SSD,首次加载从几十秒降到几秒
- 考虑llama.cpp:Ollama是封装好的运行器,llama.cpp手动编译能多调几个线程参数,但对新手收益不大
- 关掉不必要服务:蓝牙、桌面环境(如果装的是带桌面的版本)都会抢内存
六、能做什么、不能做什么
能:文本分类、情感判断、关键词提取;短文本摘要和短句翻译;家庭自动化里的自然语言入口;局域网内小工具的免费推理后端。
不能:长文档分析(上下文一长,速度和内存都扛不住);复杂推理和代码生成(质量明显不足);多用户并发(一个请求就能占满CPU)。
常见问题
Q:和云API比划算吗? A:纯算账,如果调用量不大,按量付费的云API更省心。树莓派的优势是常开、隐私、无网络依赖,适合固定任务7×24小时跑。
Q:Pi 4能跑吗? A:能,速度约为Pi 5的一半,1.5B模型大约5-7 token/s,能用但体验一般。
Q:想跑3B以上模型怎么办? A:别为难树莓派。要么上几百元的Mini PC(x86小主机跑7B无压力),要么用云GPU。树莓派的价值是"最便宜的常开小服务",不是"跑大模型"。
Q:SD卡会写坏吗? A:模型常驻内存一般没事;频繁写日志建议把日志重定向到内存盘或换NVMe。
注:速度数据来自社区实测,会受TF卡/SSD速度、散热、系统负载影响而浮动;模型版本与量化档以Ollama官方库为准。
相关文章
❓ 常见问题
Can a Pi run a useful LLM in 2026?
For short tasks, yes - 1.5B models handle summaries and intent parsing fine.
Pi 4 vs Pi 5?
Pi 5 is roughly 2x faster; only Pi 5 with 8 GB is worth it for LLMs.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
