LLM开发工具2026:按阶段排名的12个真正会用的库
LLM工具格局每周都在变。这份清单是稳的——2025年活下来、2026年仍是默认的工具,按它们重要的开发阶段排名。
💡 你将学到
LLM工具格局每周都在变。这份清单是稳的——2025年活下来、2026年仍是默认的工具,按它们重要的开发阶段排名。
活下来的12个
过去三年上线了成百上千个LLM工具,只有一小撮成了默认。这十二个(全部真实,星数2026-08-12获取)覆盖整个开发生命周期且互不重叠。
提示与评估阶段
Promptfoo(24,132星):提示词回归测试。定义测试用例、对任何模型跑、部署前抓回归。开始评估的最快方式。
DeepEval(17,533星):14+指标的LLM评估框架(G-Eval、幻觉、答案相关性)。Python原生、pytest风格。
RAGAS(15,277星):检索导向评估——忠实度、上下文精确率/召回率。评判RAG质量的标准。
编排阶段
LangChain(143,985星):最广的集成面,700+集成。被批评抽象,被喜爱触达。
LlamaIndex(51,561星):文档中心——加载、索引、查询你的数据。RAG重应用最强。
LangGraph(39,461星):带检查点和人机协作的有状态智能体工作流。2026年真智能体的默认。
检索阶段
Chroma(29,019星):最容易的向量库,进程内、Python优先。
Qdrant(33,922星):Rust向量数据库,大集合和生产更好。
pgvector(22,584星):Postgres里的向量,'不加新基础设施'的选择。
服务与可观测阶段
LiteLLM(56,118星):OpenAI兼容网关——一个API、100+供应商、成本追踪、路由。
vLLM(88,784星):开源模型推理引擎,连续批处理是吞吐标准。
Langfuse(32,895星):LLM可观测性——追踪、评估、提示词管理、每次调用成本。
阶段到工具映射
提示测试Promptfoo;评估指标DeepEval/RAGAS;编排LangChain/LlamaIndex/LangGraph;向量库Chroma/Qdrant/pgvector;网关LiteLLM;推理引擎vLLM;可观测Langfuse。
反模式:十二个一次全上
新项目不需要每个工具。最小可行栈:直接调API加Promptfoo,RAG加一个向量库。集成变多再加LangChain,做真智能体加LangGraph,有用户要盯加Langfuse。早期加的工具会成为你永远背着的依赖。
FAQ
最先学哪个工具? Promptfoo——评估是让其他所有工具决策变得可衡量的技能。 LangChain还是LlamaIndex? 文档重应用选LlamaIndex,广泛集成需求选LangChain。两者高层都值得懂。 这份清单2026年稳吗? 这十二个在2025-2026年保住了位置;变化发生在它们周围,不在它们之间。
