LLM基准测试详解2026:MMLU、GPQA、SWE-bench分数怎么看
模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?
💡 你将学到
模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?
基准测试是一门语言,学学方言
每次模型发布都带一坨基准分数。这篇讲清楚主要基准在测什么、数字意味着什么、哪里会骗人。
四大基准
- MMLU:57个学科(理工、人文、社科)的多任务知识。超广知识+推理考试。已饱和:头部模型85-90%+,第1名和第10名的差距是四舍五入误差。
- MMLU-Pro:更难、10选项版本,减少瞎猜、增加推理。现在真正能拉开差距的是它。
- GPQA:研究生级、谷歌无法直接搜到答案的问题(博士级科学题)。专家不联网也只有约65%。模型能到85%是真本事。
- SWE-bench(5,599星):真实GitHub issue,模型必须产出通过仓库测试的补丁。编程agent的金标准。它推动了整个行业:编程agent现在都拿它做宣传。
数字背后的机制
选择题便宜但有猜测空间(所以有MMLU-Pro的10选项)。生成任务需要裁判(LLM或测试)- SWE-bench用真实测试,所以最可信。LLM当裁判方便但有已知偏差:偏爱更长答案、偏爱自己的风格。
数字哪里会骗人
- 泄露:基准题进了训练数据,分数就虚高。永无止境的军备竞赛。
- 框架方差:同一个模型换评估框架分数就不同,永远核对框架版本。
- 选择性报告:公司只报自己赢的基准。没报的往往就是考砸的。
- 饱和:人人都90%时基准就失去区分度。GPQA和SWE-bench的存在正是因为MMLU没用了。
结论
基准分数测的是考试条件下的能力上限,不是工作流中的实用性。两个模型差2分以内等于没差 - 按价格、速度、上下文长度和你自己的测试提示词来选。
相关文章
相关文章
2026-07-19
Dify vs Flowise深度对比:2026年哪个AI Agent平台更适合你?
2026-08-12
Unsloth QLoRA教程2026:8GB显存就能跑的4-bit微调
2026-08-01
树莓派5跑本地LLM:真实性能数据
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
