LLM开发2026:从想法到生产的7个阶段
人人都在做LLM应用,但没几个做得好。差别在流程。这里是区分一次性demo和生产系统的7阶段开发生命周期。
💡 你将学到
人人都在做LLM应用,但没几个做得好。差别在流程。这里是区分一次性demo和生产系统的7阶段开发生命周期。
7个阶段
2026年的LLM开发不是'调API然后祈祷'。它是有清晰阶段的生命周期,每阶段有各自的工具和失败模式(星数2026-08-12获取)。
第一阶段:定义契约。输入什么(输入schema)、输出什么(输出schema)、失败长什么样。这个阶段决定后面是工程还是赌博。
第二阶段:提示词原型。最快的反馈循环:提示、评估、迭代。工具:任何聊天UI加你的真实示例。还不写代码。80%的产品价值在这里被找到。
第三阶段:结构化输出。从自由文本进到schema(JSON、函数调用)。这里的验证——schema、类型、范围——抓住多数静默失败。工具:Pydantic式验证器、OpenAI/Anthropic结构化输出。
第四阶段:检索(如果需要)。RAG:切块、embed、检索、重排。只有模型缺知识时才加。框架:LangChain(143,985星)、LlamaIndex(51,561星)或直接集成向量库。
第五阶段:评估。多数团队跳过然后后悔的阶段。建50-200条真实输入加预期行为的黄金集;每次改动都拿它打分。工具:RAGAS(15,277星)、DeepEval(17,533星)、Promptfoo(24,132星)或一个简单脚本。
第六阶段:服务与监控。部署在OpenAI兼容API后面(LiteLLM 56,118星当网关),记录每次调用,盯成本、延迟、失败率。可观测性:Langfuse(32,895星)是2026年默认。
第七阶段:用数据迭代。真实流量产出黄金集没预测到的失败。把它们喂回去:加进评估集、修提示词或检索、重新部署。这个循环才是真正的产品。
两大杀手
跳过第五阶段——靠感觉上线意味着每次改提示词都是掷硬币。第一阶段含糊——'好输出'没定义,后面任何阶段都无法评估。
有效的时间分配
大约:40%提示词加评估循环(二到五阶段),30%检索质量(需要RAG时),20%服务与监控,10%其他。倒过来的团队——先花几周搞基础设施再碰提示词——以同样的模式失败。
FAQ
典型LLM应用要多久? 原型几天;带评估循环的受监控生产系统2-4周。 需要LangChain吗? 不需要——简单应用直接调API加验证器更干净。框架在检索、智能体和多步流程上有用。 最便宜的起步方式? 聊天UI、20条真实示例、免费档API。评估说产品能用了再加基础设施。
