Hugging Face上的LLM评估指标:排行榜与用法
Hugging Face托管着最大的开源LLM排行榜。2026年如何读懂它们。
Hugging Face上的LLM评估指标
Hugging Face的排行榜是选开源模型的第一站。关键指标:MMLU(57个学科通用知识)、HumanEval/MBPP(代码生成)、GSM8K/MATH(数学推理)、MT-Bench(聊天质量)、RAGAS(11k+星,RAG专用:忠实度、答案相关性)。
读榜要点:确认模型checkpoint版本(base/instruct/chat差别很大)、检查评估库版本、用同一harness评估的才可比、few-shot设置影响分数。
实例:DeepSeek-V3(104,067星)MMLU居开源榜首,Qwen2.5-Coder 7B在HumanEval上超过很多13B模型。
相关文章
2026-07-14
2026本地大模型部署指南:Windows/Mac/Linux运行AI模型
2026-07-13
用Docker本地运行Ollama:2026完整部署指南
2026-07-14
2026开源大模型基准测试对比:Llama 3.1 vs Qwen 2.5 vs Mistral vs Phi-3
