RAG评估指标2026:用Ragas衡量检索质量
RAG应用答得自信,但一半引用是错的。需要指标而不是感觉。
💡 你将学到
RAG应用答得自信,但一半引用是错的。需要指标而不是感觉。
标题:2026年的RAG评估指标:使用Ragas(1.5万星标)衡量检索质量
RAG评估指标:告诉你检索失效的数字
大多数RAG失败本质上是检索失败。生成器本身回答得不错,但检索器给了它错误的文档。Ragas是一个开源框架,专门用于衡量这种分离,截至2026年8月,它在GitHub上拥有15,076个星标,是生态系统中使用最广泛的RAG评估库。
四个关键指标
Ragas定义了四个核心指标,对应两种失败模式:
检索侧: - 上下文精确度(Context Precision) —— 检索器返回的块中,有多少确实与问题相关。 - 上下文召回率(Context Recall) —— 语料库中所有相关的块中,检索器找到了多少。
生成侧: - 忠实度(Faithfulness) —— 答案中是否包含检索上下文不支持的主张?忠实度低意味着幻觉。 - 答案相关性(Answer Relevancy) —— 答案是否真正回答了所提出的问题,还是偏离到了其他方面?
具体工作流程
from ragas import evaluate
from ragas.metrics import faithfulness, context_recall
result = evaluate(dataset, metrics=[faithfulness, context_recall])
输入问题-答案-上下文三元组,Ragas会使用LLM法官对每个样本进行打分。每次语料库变更时都运行此流程。如果你切换了嵌入模型后,上下文召回率从0.82下降到0.61,你就能在十分钟内发现这个回归,而不是等到用户投诉才察觉。
团队容易在哪里卡住
最常见的错误是只评估忠实度。一个RAG系统可能忠实度得分为0.9,但每个问题都检索相同的两个块——技术上忠实,实际上无用。始终将检索指标与生成指标配对使用。如果你只跟踪一个数字,那就选上下文召回率,因为它是第一个恶化的指标,并且能提前一周预测其他指标会下降。
常见问题
Ragas需要LLM API吗? 它使用LLM作为法官,因此需要,但它支持任何提供商,包括本地模型。
我需要多少样本? 50-100个有代表性的问题能提供稳定的信号;20个样本可用于初步测试。
它只用于RAG吗? 它也可以评估智能体工具调用轨迹和摘要任务。
Ragas与普通pytest相比? Ragas专为RAG维度设计;pytest是底层的运行框架。
相关文章
❓ 常见问题
Does Ragas need an LLM API?
It uses an LLM as judge, so yes, but it works with any provider including local models.
How many samples do I need?
50-100 representative questions give a stable signal; 20 works for a first pass.
Is it only for RAG?
It also evaluates agent tool-use traces and summarization tasks.
Ragas vs plain pytest?
Ragas is purpose-built for RAG dimensions; pytest is the runner underneath.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
