LLM评估指标论文:8篇必读基础论文

📘 AI教程 2026-08-01 约 4 分钟阅读

八篇定义了LLM评估方式的论文,从MMLU到RAGAS。

LLM评估指标论文

8篇奠基论文:MMLU(2020,57学科通用知识基准)、HELM(2022,斯坦福多指标评估)、GSM8K(2021,数学推理)、HumanEval(2021,代码生成pass@k)、思维链(2022,推理步骤提示)、RAGAS(2023,RAG评估:忠实度/答案相关性/上下文精度)、MT-Bench(2023,LLM作为裁判)、LLM-as-a-Judge(2023,GPT-4当评估器)。

2026年实践:MMLU+HumanEval+GSM8K仍是模型卡默认组合,RAG系统默认RAGAS,CI流水线用LLM-as-judge替代人工评估。全部可在arXiv免费阅读。

相关文章
2026-07-14
2026本地大模型部署指南:Windows/Mac/Linux运行AI模型
2026-07-13
用Docker本地运行Ollama:2026完整部署指南
2026-07-14
2026开源大模型基准测试对比:Llama 3.1 vs Qwen 2.5 vs Mistral vs Phi-3

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论