LLM基准测试详解2026:MMLU、GPQA、SWE-bench分数怎么看

📘 教程 2026-08-10 约 5 分钟阅读

模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?

💡 你将学到

模型发布都报MMLU 90%、GPQA 85% - 但这些基准到底在测什么?数字能信几分?

基准测试是一门语言,学学方言

每次模型发布都带一坨基准分数。这篇讲清楚主要基准在测什么、数字意味着什么、哪里会骗人。

四大基准

数字背后的机制

选择题便宜但有猜测空间(所以有MMLU-Pro的10选项)。生成任务需要裁判(LLM或测试)- SWE-bench用真实测试,所以最可信。LLM当裁判方便但有已知偏差:偏爱更长答案、偏爱自己的风格。

数字哪里会骗人

  1. 泄露:基准题进了训练数据,分数就虚高。永无止境的军备竞赛。
  2. 框架方差:同一个模型换评估框架分数就不同,永远核对框架版本。
  3. 选择性报告:公司只报自己赢的基准。没报的往往就是考砸的。
  4. 饱和:人人都90%时基准就失去区分度。GPQA和SWE-bench的存在正是因为MMLU没用了。

结论

基准分数测的是考试条件下的能力上限,不是工作流中的实用性。两个模型差2分以内等于没差 - 按价格、速度、上下文长度和你自己的测试提示词来选。

相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
2026本地大模型部署指南:Windows/Mac/Linux运行AI模型

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论