AI编程基准2026:SWE-bench、LiveCodeBench分数怎么看
每个编程模型发布都宣称破了某基准纪录。但SWE-bench、LiveCodeBench、HumanEval测的是完全不同的东西,而且挑数字的现象很严重。
💡 你将学到
每个编程模型发布都宣称破了某基准纪录。但SWE-bench、LiveCodeBench、HumanEval测的是完全不同的东西,而且挑数字的现象很严重。
三个编程基准测的东西完全不同:HumanEval是2021年OpenAI的164道手写Python函数题,早被训练数据污染、已经饱和,前沿模型90%以上,基本可以忽略;SWE-bench(仓库5.6千星)是12个Python仓库的真实GitHub issue,模型要在完整代码库里修bug并通过测试,最难也最真实,Verified子集500题人工确认过;LiveCodeBench持续更新新题抗污染,分数最可信。2026年现实分数:SWE-bench Verified前沿60-75%、开源大模型40-55%;LiveCodeBench前沿55-70%。看发布稿的套路:只报HumanEval就是在藏东西;报SWE-bench要看harness版本;没有无训练数据污染声明就当有泄漏。还没被测量的:长会话agentic编程、代码评审质量、成本效率。最终基准永远是自己的代码库,拿20个真实issue跑一遍再买单。
相关文章
2026-08-10
海韵计算器又泄密了:三款 RTX 50 SUPER 齐刷刷亮相,5080 SUPER 奔着 415W 去了
2026-08-10
微星给长鑫颗粒松绑,AMD 主板终于不是 DDR5-6800 的天花板了
2026-08-09
海韵计算器又泄密了:三款 RTX 50 SUPER 齐刷刷亮相,5080 SUPER 奔着 415W 去了
