LocalAI部署教程:本地免费跑大模型API
每个月OpenAI的账单好几百,想切到本地模型省钱又怕太折腾。有没有一个工具能一键部署本地AI,还能兼容OpenAI的API格式?
💡 你将学到
每个月OpenAI的账单好几百,想切到本地模型省钱又怕太折腾。有没有一个工具能一键部署本地AI,还能兼容OpenAI的API格式?
LocalAI是什么
LocalAI是一个开源项目,它做了一件事:提供一个跟OpenAI完全兼容的API,但背后跑的是本地模型。
你的代码不需要改任何东西,只要把API地址从api.openai.com改成localhost:8080,一切照常运行。
GitHub 32000+星,社区活跃。
快速安装
# Docker一键启动
docker run -p 8080:8080 \
-v $PWD/models:/models \
-e MODELS_PATH=/models \
localai/localai:latest
或者直接下载二进制:
# Linux/Mac
curl -sSf https://localai.io/install.sh | bash
# 启动后访问 http://localhost:8080
安装模型
LocalAI支持自动下载模型。创建配置文件:
# models/qwen.yaml
name: qwen2.5-7b
backend: llama-cpp
parameters:
model: https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf
重启LocalAI,它会自动下载模型。
测试
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5-7b",
"messages": [{"role": "user", "content": "你好,用中文介绍一下自己"}]
}'
返回格式跟OpenAI一模一样。
还能做什么
LocalAI不只是LLM,它还支持: - 图片生成(Stable Diffusion) - 语音转文字(Whisper) - 文字转语音(Piper TTS) - Embeddings(文本向量化)
全部本地运行,全部兼容OpenAI API格式。
硬件要求
| 模型大小 | 最低内存 | 推荐显卡 | 速度 |
|---|---|---|---|
| 3B-7B | 8GB RAM | RTX 3060 | 快 |
| 13B | 16GB RAM | RTX 4090 | 中等 |
| 30B+ | 32GB+ | 多卡 | 慢 |
纯CPU也能跑,但速度和蜗牛差不多(7B模型每秒2-3个字)。
总结
LocalAI让本地部署模型变得跟调API一样简单。适合想省API费的个人开发者、数据不能出内网的企业用户、想离线使用AI的场景。
唯一的代价就是你需要一块过得去的显卡。
相关文章
相关文章
2026-08-12
AI模型服务化2026:从本地原型到生产API的完整路径
2026-08-13
2026 年在安卓上跑 LLM:5 种把本地模型装进手机的方法
2026-07-19
AI Agent记忆系统设计:让AI记住对话历史
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
