Reasoning & knowledge
MMLU-Pro
Harder multi-task language understanding across STEM and professional domains; reported results depend on prompt, shot count, and reasoning/tool settings.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Reasoning & knowledge
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 88 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Kimi K2.587.1%
Moonshotopen
- 2Nemotron 3 Ultra86.8%
NVIDIAopen
- 3Grok 486.6%
xAIclosed
- 4Gemini 2.5 Pro86.2%
Googleclosed
- 5DeepSeek V3.286.2%
DeepSeekopen
- 6o385.3%
OpenAIclosed
- 7Gemma 4 31B85.2%
Googleopen
- 8DeepSeek R1-052885.0%
DeepSeekopen
- 9DeepSeek V3.184.8%
DeepSeekopen
- 10o1 Preview84.8%
OpenAIclosed
- 11Qwen3 Max84.1%
Alibabaclosed
- 12o184.1%
OpenAIclosed
- 13DeepSeek R184.0%
DeepSeekopen
- 14Gemma 4 26B82.6%
Googleopen
- 15Kimi K281.1%
Moonshotopen
- 16Mistral Large 380.7%
Mistralopen
- 17GPT-4.180.6%
OpenAIclosed
- 18Qwen3-Next 80B-A3B80.6%
Alibabaopen
- 19Llama 4 Maverick80.5%
Metaopen
- 20Grok 379.9%
xAIclosed
- 21DeepSeek-R1-Distill-Llama-70B79.5%
DeepSeekopen
- 22o3-mini79.1%
OpenAIclosed
- 23Qwen3 Coder 480B78.8%
Alibabaopen
- 24Nemotron Nano 3 30B78.3%
NVIDIAopen
- 25GPT-4.1 Mini78.1%
OpenAIclosed
- 26Granite 4.2 30B77.6%
IBMopen
- 27Claude 3.5 Sonnet (Oct)77.2%
Anthropicclosed
- 28QwQ-32B76.4%
Alibabaopen
- 29Devstral 276.2%
Mistralopen
- 30DeepSeek V375.9%
DeepSeekopen
- 31OLMo 3 32B Think75.9%
Ai2open
- 32Sonar Pro75.5%
Perplexityclosed
- 33Claude 3.5 Sonnet75.1%
Anthropicclosed
- 34Llama 4 Scout74.3%
Metaopen
- 35Phi-4 Reasoning74.3%
Microsoftopen
- 36o1 Mini74.2%
OpenAIclosed
- 37Granite 4.2 8B74.0%
IBMopen
- 38GPT-4o (May 2024)74.0%
OpenAIclosed
- 39DeepSeek-R1 Distill Qwen 14B74.0%
DeepSeekopen
- 40DeepSeek-R1-Distill-Qwen-32B73.9%
DeepSeekopen
- 41Llama 3.1 405B73.3%
Metaopen
- 42Command A71.2%
Cohereclosed
- 43Qwen2.5 72B71.1%
Alibabaopen
- 44Qwen3-Coder 30B-A3B70.6%
Alibabaopen
- 45Phi-470.4%
Microsoftopen
- 46Pixtral Large70.1%
Mistralclosed
- 47Claude 3 Opus69.6%
Anthropicclosed
- 48GPT-4 Turbo69.4%
OpenAIclosed
- 49Ministral 3 14B69.3%
Mistralopen
- 50Mistral Small 3.269.1%
Mistralopen
- 51Qwen2.5 32B Instruct69.0%
Alibabaopen
- 52Llama-3.1-Nemotron-70B Instruct69.0%
NVIDIAopen
- 53Llama 3.3 70B68.9%
Metaopen
- 54Sonar68.9%
Perplexityclosed
- 55Mistral Medium 3.168.3%
Mistralclosed
- 56Gemma 3 27B67.5%
Googleopen
- 57Reka Flash 366.9%
Rekaopen
- 58Llama 3.1 70B66.4%
Metaopen
- 59GPT-4.1 Nano65.7%
OpenAIclosed
- 60GPT-4o Mini64.8%
OpenAIclosed
- 61Ministral 3 8B64.2%
Mistralopen
- 62Qwen2.5 14B Instruct63.7%
Alibabaopen
- 63Claude Haiku 3.563.4%
Anthropicclosed
- 64Gemma 3 12B60.6%
Googleopen
- 65Claude 3 Sonnet57.9%
Anthropicclosed
- 66Jamba 1.5 Large57.2%
AI21open
- 67Gemini 1.5 Flash-8B56.9%
Googleclosed
- 68Qwen2.5 7B56.3%
Alibabaopen
- 69GPT-456.2%
OpenAIclosed
- 70DeepSeek-R1 Distill Llama 8B54.3%
DeepSeekopen
- 71Mixtral 8x22B53.7%
Mistralopen
- 72Mistral Small52.9%
Mistralclosed
- 73Phi-4-mini52.8%
Microsoftopen
- 74Ministral 3 3B52.4%
Mistralopen
- 75Mistral Large51.5%
Mistralclosed
- 76OLMo 2 32B51.1%
Ai2open
- 77Claude 2.149.5%
Anthropicclosed
- 78Claude 248.6%
Anthropicclosed
- 79Phi-4-multimodal48.5%
Microsoftopen
- 80Llama 3.1 8B48.3%
Metaopen
- 81GPT-3.5 Turbo46.2%
OpenAIclosed
- 82Granite 4.0 Micro44.7%
IBMopen
- 83Gemma 3 4B43.6%
Googleopen
- 84Phi-3 Mini 3.8B43.5%
Microsoftopen
- 85Gemini 1.0 Pro43.1%
Googleclosed
- 86DeepSeek Coder V2 Lite42.9%
DeepSeekopen
- 87DBRX Instruct39.7%
Databricksopen
- 88Mixtral 8x7B38.7%
Mistralopen