树莓派5跑Ollama:不到100美元跑本地LLM
树莓派5便宜又省电——但能跑现代LLM吗?选对模型就行。
💡 你将学到
树莓派5便宜又省电——但能跑现代LLM吗?选对模型就行。
2026年树莓派5上的Ollama:不到100美元运行本地大语言模型
树莓派5(8GB版,约80美元)无法运行70B模型——但运行小型模型进行聊天、摘要和轻量级智能体任务完全没问题。使用Ollama,15分钟即可完成设置。以下是真实的性能表现。
为什么树莓派5可行
- 8GB内存版本可运行3B-8B量化模型
- 3B模型约5-10 tokens/秒——可用于聊天
- 功耗仅5W——全天候运行成本极低
- 官方树莓派AI套件为图像模型增加26 TOPS NPU算力
安装步骤
# 1. 安装Ollama(官方脚本支持ARM64)
curl -fsSL https://ollama.com/install.sh | sh
# 2. 拉取一个小型模型
ollama pull qwen2.5:3b
# 3. 开始聊天
ollama run qwen2.5:3b
按内存配置的模型推荐
| 树莓派型号 | 内存 | 推荐模型 | 速度 |
|---|---|---|---|
| Pi 5 4GB | 4GB | qwen2.5:1.5b, llama3.2:1b | 8-15 tok/s |
| Pi 5 8GB | 8GB | qwen2.5:3b, phi-3-mini | 5-10 tok/s |
| Pi 5 + AI套件 | 8GB | + 通过NPU运行小型视觉模型 | 更快 |
实际可用的应用场景
- 家庭助手,搭配自定义系统提示词(8GB模型,回答质量尚可)
- 离线文档摘要(3B模型足以处理短文档)
- 隐私敏感型聊天(数据永不离开你的网络)
- 教学/学习LLM概念(可自由查看提示词和输出)
无法实现的功能
- 编程智能体和复杂推理(模型太小)
- 大上下文窗口(8GB内存将上下文限制在约8-16K tokens)
- 长文本实时翻译
- 任何需要30B+模型的任务
常见问题
相比云端API值得吗? 用于学习和隐私保护,值得。对于重型生产负载,云端API或GPU机器每美元能获得更高性能。
可以集群多台树莓派吗? 可以——llama.cpp支持分布式推理,但网络开销限制了收益;2台树莓派实用,4台以上通常不划算。
AI套件对LLM有帮助吗? NPU加速视觉/嵌入模型;文本LLM仍在CPU上运行。加速效果因模型而异。
相关文章
❓ 常见问题
相比云端API值得吗?
用于学习和隐私保护,值得。对于重型生产负载,云端API或GPU机器每美元能获得更高性能。
可以集群多台树莓派吗?
可以——llama.cpp支持分布式推理,但网络开销限制了收益;2台树莓派实用,4台以上通常不划算。
AI套件对LLM有帮助吗?
NPU加速视觉/嵌入模型;文本LLM仍在CPU上运行。加速效果因模型而异。
相关文章
2026-08-10
LLM是什么意思:大语言模型原理通俗版
2026-07-16
AI Agent测试框架:怎么保证Agent每次表现一致?
2026-07-16
AI Agent权限控制:普通用户和管理员能用不同的工具
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
