LLM RAG 可观测性 2026:用开源工具盯住 Token、延迟和回答质量
RAG 应用测试时好好的,一上线就出问题:回答变慢、引用错误、静默失败。LLM 可观测性就是缺的那一层,而且最好的工具都是开源的。
💡 你将学到
RAG 应用测试时好好的,一上线就出问题:回答变慢、引用错误、静默失败。LLM 可观测性就是缺的那一层,而且最好的工具都是开源的。
RAG 应用为什么会静默失败
RAG 管道有三个普通监控永远看不到的失败点:检索(召回的分块对不对?)、生成(模型真的用了这些内容吗?)和成本(一次回答烧了多少 token?)。2026 年开源的答案是被称为 LLM 可观测性的一类工具,你一定会遇到的两个名字是 Langfuse(32,973 stars)和 Arize Phoenix(11,015 stars),均为 2026-08-13 实测。
RAG 要盯什么
检索指标:返回了多少文档、相似度分数、答案引用的是第一名还是第七名的分块。引用位置靠后通常意味着分块策略或检索器有问题。
生成指标:每次请求的输入/输出 token、首 token 延迟和总延迟。当某个查询从 1 秒变成 9 秒,可观测性告诉你到底是哪一步退化了。
质量信号:配合 RAGAS 或手动追踪,给每条 trace 打忠实度(答案有没有忠于检索内容)和相关度分。答案忽略了检索文档,那是管道 bug,不是模型脾气。
Langfuse:带成本的追踪
Langfuse 用几行代码就能给 LangChain、LlamaIndex 和裸 OpenAI 调用埋点。每条 trace 显示 prompt、检索上下文、补全内容和 token 成本。支持 Docker Compose 全自托管,兼容 OpenTelemetry。
Arize Phoenix:内置评测
Phoenix 在评测上更深入:能对 trace 跑 LLM 当裁判的评测、检测开发与生产分布漂移、给 embedding 做 UMAP 可视化。设置重一些,但每周发版的团队会受益于评测优先的工作流。
2026 基础栈
- 用 OpenTelemetry 埋点(厂商中立)
- 把 trace 送进 Langfuse 看成本和延迟
- 每晚对 100 条抽样查询跑 RAGAS 评测
- 忠实度跌破阈值(从 0.8 起步)就告警
先上 Langfuse,需要系统性评测时再加 Phoenix。两者开源,数据留在自己服务器上。
