LLM Evaluation Metrics on Hugging Face: Open Source Leaderboards

📘 AI Tutorials 💬 🔥 Trending

🩺 Summary

How do you use Hugging Face open leaderboards to evaluate models?

📝 Details

Open LLM Leaderboard: MMLU, TruthfulQA, HellaSwag, ARC. Top: Llama 3.1 70B (82.3), Qwen 2.5 72B (81.8). Use lm_eval for custom.