LLM可观测性2026:用Langfuse追踪每个token,10分钟上手

🔧 AI工具 2026-08-02 约 5 分钟阅读

LLM应用又慢又贵,却查不出是哪个提示词或模型调用的问题。你需要链路追踪。

💡 你将学到

LLM应用又慢又贵,却查不出是哪个提示词或模型调用的问题。你需要链路追踪。

📜 目录

标题:LLM可观测性2026:用Langfuse(32k星标)追踪每个Token——10分钟完成部署

LLM可观测性:看不见的问题就无法修复

LLM应用以传统监控无法察觉的方式失败:返回空结果的提示词、陷入循环的工具调用、静默截断的上下文窗口。LLM可观测性平台在常规日志和指标之上增加追踪和评估功能。Langfuse是领先的开源方案——截至2026年8月拥有32,279个GitHub星标,并提供功能丰富的社区版供自托管。

一条追踪能告诉你什么

使用Langfuse,每个用户请求都会变成一条追踪:使用的提示词模板、调用的模型、token数量、延迟、成本、最终输出——以及中间的任何工具调用和检索结果。你可以回放单个糟糕的响应,并精确查看哪个阶段产生了它。这一能力将调试从猜测转变为取证。

10分钟完成部署

from langfuse import Langfuse
langfuse = Langfuse()  # 读取 LANGFUSE_PUBLIC_KEY / SECRET_KEY

@langfuse.observe()
async def generate(prompt):
    return await client.chat.completions.create(...)

@observe 装饰器自动捕获输入、输出、延迟和成本。Python、JS以及OpenAI/Anthropic/LangChain的集成SDK均支持零代码修改使用。

三个你离不开的仪表盘

  1. 追踪(Traces) - 逐请求调试,包含完整的提示词/输出历史。
  2. 指标(Metrics) - 按模型、提示词、用户统计的成本和延迟趋势。
  3. 评估(Evals) - 对记录的追踪运行自动化评分(正确性、毒性),并将回归问题转化为测试用例。

成本现实

自托管的Langfuse是免费软件(核心部分采用MIT许可);云服务提供每月50,000次观测的免费额度。自托管的基础设施成本很低——一个小型Postgres实例加一个容器。对于每月在LLM API上花费几百美元以上的团队,可观测性只需发现一个超预算的提示词就能收回成本。

常见问题

Langfuse真的免费吗? 核心是MIT许可的开源软件;自托管完全免费。

它能与本地模型一起使用吗? 可以——它会追踪任何调用,包括Ollama和vLLM端点。

Langfuse vs LangSmith? LangSmith是LangChain的托管产品;Langfuse是功能类似的开源替代方案。

它能监控成本吗? 可以,如果你配置了模型定价,它会追踪每次追踪的成本。

相关文章

❓ 常见问题

Is Langfuse really free?

The core is MIT-licensed open source; self-hosting is free.

Does it work with local models?

Yes - it traces any call, including Ollama and vLLM endpoints.

Langfuse vs LangSmith?

LangSmith is LangChain's hosted product; Langfuse is the open-source alternative with a similar feature set.

Can it monitor costs?

Yes, it tracks cost per trace if you configure model pricing.

相关文章
2026-08-17
2026 交友软件最佳 AI 头像工具:6 款提高匹配率的工具
2026-08-01
GitHub上的LLM越狱提示词数据集
2026-08-12
智能体AI评估工具2026:测试替你行动的多步智能体

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论