LLM Evaluation Metrics on Hugging Face: Open Source Leaderboards
🩺 Summary
How do you use Hugging Face open leaderboards to evaluate models?
📝 Details
Open LLM Leaderboard: MMLU, TruthfulQA, HellaSwag, ARC. Top: Llama 3.1 70B (82.3), Qwen 2.5 72B (81.8). Use lm_eval for custom.
💬 Comments (0)