LLM基准测试详解2026:MMLU、GPQA、SWE-bench分数怎么看
模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?
💡 你将学到
模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?
基准测试是一门语言,学学方言
每次模型发布都带一坨基准分数。这篇讲清楚主要基准在测什么、数字意味着什么、哪里会骗人。
四大基准
- MMLU:57个学科(理工、人文、社科)的多任务知识。超广知识+推理考试。已饱和:头部模型85-90%+,第1名和第10名的差距是四舍五入误差。
- MMLU-Pro:更难、10选项版本,减少瞎猜、增加推理。现在真正能拉开差距的是它。
- GPQA:研究生级、谷歌无法直接搜到答案的问题(博士级科学题)。专家不联网也只有约65%。模型能到85%是真本事。
- SWE-bench(5,599星):真实GitHub issue,模型必须产出通过仓库测试的补丁。编程agent的金标准。它推动了整个行业:编程agent现在都拿它做宣传。
数字背后的机制
选择题便宜但有猜测空间(所以有MMLU-Pro的10选项)。生成任务需要裁判(LLM或测试)- SWE-bench用真实测试,所以最可信。LLM当裁判方便但有已知偏差:偏爱更长答案、偏爱自己的风格。
数字哪里会骗人
- 泄露:基准题进了训练数据,分数就虚高。永无止境的军备竞赛。
- 框架方差:同一个模型换评估框架分数就不同,永远核对框架版本。
- 选择性报告:公司只报自己赢的基准。没报的往往就是考砸的。
- 饱和:人人都90%时基准就失去区分度。GPQA和SWE-bench的存在正是因为MMLU没用了。
结论
基准分数测的是考试条件下的能力上限,不是工作流中的实用性。两个模型差2分以内等于没差 - 按价格、速度、上下文长度和你自己的测试提示词来选。
相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
2026本地大模型部署指南:Windows/Mac/Linux运行AI模型
