LocalAI部署教程:本地免费跑大模型API

📘 教程 2026-07-19 约 2 分钟阅读

每个月OpenAI的账单好几百,想切到本地模型省钱又怕太折腾。有没有一个工具能一键部署本地AI,还能兼容OpenAI的API格式?

💡 你将学到

每个月OpenAI的账单好几百,想切到本地模型省钱又怕太折腾。有没有一个工具能一键部署本地AI,还能兼容OpenAI的API格式?

📜 目录

LocalAI是什么

LocalAI是一个开源项目,它做了一件事:提供一个跟OpenAI完全兼容的API,但背后跑的是本地模型。

你的代码不需要改任何东西,只要把API地址从api.openai.com改成localhost:8080,一切照常运行。

GitHub 32000+星,社区活跃。

快速安装

# Docker一键启动
docker run -p 8080:8080 \
  -v $PWD/models:/models \
  -e MODELS_PATH=/models \
  localai/localai:latest

或者直接下载二进制:

# Linux/Mac
curl -sSf https://localai.io/install.sh | bash

# 启动后访问 http://localhost:8080

安装模型

LocalAI支持自动下载模型。创建配置文件:

# models/qwen.yaml
name: qwen2.5-7b
backend: llama-cpp
parameters:
  model: https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf

重启LocalAI,它会自动下载模型。

测试

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-7b",
    "messages": [{"role": "user", "content": "你好,用中文介绍一下自己"}]
  }'

返回格式跟OpenAI一模一样。

还能做什么

LocalAI不只是LLM,它还支持: - 图片生成(Stable Diffusion) - 语音转文字(Whisper) - 文字转语音(Piper TTS) - Embeddings(文本向量化)

全部本地运行,全部兼容OpenAI API格式。

硬件要求

模型大小 最低内存 推荐显卡 速度
3B-7B 8GB RAM RTX 3060
13B 16GB RAM RTX 4090 中等
30B+ 32GB+ 多卡

纯CPU也能跑,但速度和蜗牛差不多(7B模型每秒2-3个字)。

总结

LocalAI让本地部署模型变得跟调API一样简单。适合想省API费的个人开发者、数据不能出内网的企业用户、想离线使用AI的场景。

唯一的代价就是你需要一块过得去的显卡。

相关文章

相关文章
2026-08-12
AI模型服务化2026:从本地原型到生产API的完整路径
2026-08-13
2026 年在安卓上跑 LLM:5 种把本地模型装进手机的方法
2026-07-19
AI Agent记忆系统设计:让AI记住对话历史

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论