evaluation-datasets edinburgh-dawg/mmlu-redux-2.0 Viewer • Updated Feb 25, 2025 • 5.7k • 18k • 38 TIGER-Lab/MMLU-Pro Benchmark • Updated May 2 • 12.1k • 142k • 502 CohereLabs/Global-MMLU Viewer • Updated Aug 14, 2025 • 602k • 17.2k • 163 Idavidrein/gpqa Benchmark • Updated Mar 5 • 1.25k • 86.2k • 487
medical-datasets ruslanmv/ai-medical-chatbot Viewer • Updated Mar 23, 2024 • 257k • 3.28k • 249 michsethowusu/Code-170k-luo Viewer • Updated Oct 30, 2025 • 169k • 44 edinburgh-dawg/mmlu-redux-2.0 Viewer • Updated Feb 25, 2025 • 5.7k • 18k • 38
evaluation-datasets edinburgh-dawg/mmlu-redux-2.0 Viewer • Updated Feb 25, 2025 • 5.7k • 18k • 38 TIGER-Lab/MMLU-Pro Benchmark • Updated May 2 • 12.1k • 142k • 502 CohereLabs/Global-MMLU Viewer • Updated Aug 14, 2025 • 602k • 17.2k • 163 Idavidrein/gpqa Benchmark • Updated Mar 5 • 1.25k • 86.2k • 487
medical-datasets ruslanmv/ai-medical-chatbot Viewer • Updated Mar 23, 2024 • 257k • 3.28k • 249 michsethowusu/Code-170k-luo Viewer • Updated Oct 30, 2025 • 169k • 44 edinburgh-dawg/mmlu-redux-2.0 Viewer • Updated Feb 25, 2025 • 5.7k • 18k • 38