LLM评估框架2026:用Promptfoo像OpenAI一样测试提示词
提示词这次能用,下次就翻车。需要一个可重复的LLM输出测试方法。
💡 你将学到
提示词这次能用,下次就翻车。需要一个可重复的LLM输出测试方法。
LLM 评估框架 2026:如何像 OpenAI 那样测试提示词(Promptfoo 指南)
LLM 评估框架 2026:别再未经测试就发布提示词了
判断 LLM 改动是否有效的最快方法,不是靠肉眼观察——而是运行测试套件。Promptfoo 正是这样一个开源 LLM 评估框架,截至 2026 年 8 月,它在 GitHub 上已有 23,818 颗星,并且每周都有活跃的版本发布。OpenAI 和 Anthropic 的工程师也被列为用户,这说明它已经经受住了真实生产环境的考验。
提示词评估的实际样子
一个 promptfoo 配置是一个包含三个部分的 YAML 文件:提供者(providers)、提示词(prompts)和测试(tests)。你将其指向一个 LLM API(OpenAI、Anthropic、Gemini、DeepSeek 或本地 vLLM 端点),列出你的提示词变体,然后编写断言,例如 contains: refund policy 或 similar: the API key belongs in the header。
运行 npx promptfoo eval,你会得到一个按提示词分组的通过/失败率并排表格。更改一条系统提示词,数字就会变动。这就是全部价值所在:你现在可以量化提示词质量,而不是靠猜测。
能捕获 80% 回归问题的三个检查项
- 精确匹配断言——输出必须包含关键短语(价格、日期、政策名称)。
- 相似度阈值——基于嵌入的参考答案对比,适用于摘要类任务。
- LLM 作为裁判——让更强的模型来评估有用性。Promptfoo 内置了预置的裁判,因此你无需从头编写评分提示词。
内置红队测试
自 2025 年起,promptfoo 已整合了 AI 红队测试功能:它可以生成对抗性输入(越狱尝试、提示注入),并检查你的防护机制是否有效。这使评估工具变成了安全工具,因此安全团队现在会在每次提示词变更时,在 CI 中运行它。
常见问题
promptfoo 是免费的吗? 是的,核心评估引擎基于 MIT 许可证开源。可选的托管云仪表板是付费的。
它能测试本地模型吗? 是的,它支持 Ollama 以及任何兼容 OpenAI 的端点。
设置需要多长时间? 首次配置(3 个提示词和 10 个测试用例)大约需要 15 分钟。
它能取代人工审查吗? 不能。它只能捕获回归问题;质量的定义仍需由人来决定。
相关文章
❓ 常见问题
Is promptfoo free?
Yes, the core eval engine is MIT-licensed open source. A hosted cloud dashboard is optional.
Can it test local models?
Yes, it supports Ollama and any OpenAI-compatible endpoint.
How long does setup take?
first config with 3 prompts and 10 test cases takes about 15 minutes.
Does it replace human review?
No. It catches regressions; humans still decide what quality means.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
