LLM API 网关 2026:一个端点统管所有模型
OpenAI、Claude、Gemini、本地模型——为每个管理 key 和端点是场混乱。LLM 网关把它们统一到一个 API 后面。这是做法。
💡 你将学到
OpenAI、Claude、Gemini、本地模型——为每个管理 key 和端点是场混乱。LLM 网关把它们统一到一个 API 后面。这是做法。
📜 目录
多模型混乱
生产 AI 团队很少只用一家模型:便宜任务走便宜模型、难题用前沿模型、价格变化就换供应商。手动管理这一切——key、端点、重试、每家预算——正是 LLM 网关消除的混乱。
网关做什么
- 一个 API 接所有供应商(OpenAI 兼容接口)
- Key 管理:团队一个 key,各家 key 存服务端
- 路由:发到特定模型或按规则自动路由
- 故障转移/重试:一家失败试下一家
- 可观测:日志、token 数、每次请求成本
- 预算控制:按 key、团队、模型设上限
开源网关
LiteLLM(56,266 stars,2026-08-14):事实标准:一个 OpenAI 兼容端点后面暴露 100+ 供应商(OpenAI、Anthropic、Gemini、Azure、Ollama、vLLM...)。久经考验、社区巨大、配置是单个 YAML。从这里开始。
one-api(36,372 stars):中文生态里流行的统一网关:多供应商、基于 token 的访问、干净的 admin UI 给用户分发 key。
new-api(45,082 stars):one-api 的分支,供应商更多、仪表盘更好、有计费功能。社区做转售或团队计费的选择。
Kong AI Gateway(43,974 stars):企业级选项:Kong 的 API 网关加 AI 插件,跨 LLM 供应商路由、负载均衡、限流。已经跑 Kong 时选它。
Cloudflare AI Gateway:托管选项:一个端点、缓存、限流、日志、跨供应商故障转移,跑在 Cloudflare 边缘网络。免费层大方。
15 分钟配置(LiteLLM)
(见英文版代码块)
你的应用代码在换供应商时永远不用改——只改配置。
FAQ
LiteLLM 能上生产吗? 能——数千家公司生产环境跑它;很多 LLM 平台用它驱动。
网关加延迟吗? 几毫秒代理开销——相比 API 延迟可忽略。
能混合云和本地模型吗? 能——这是头号用例:本地跑便宜/敏感的,云跑难的。
托管还是自托管? 要零运维选 Cloudflare AI Gateway;要控制和零按请求成本选 LiteLLM。
