Reasoning & knowledge
MATH-500
500-problem subset of the MATH competition dataset covering algebra, geometry, and number theory; scores are protocol-sensitive and not interchangeable with AIME results.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Reasoning & knowledge
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 67 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1o399.2%
OpenAIclosed
- 2Grok 499.0%
xAIclosed
- 3DeepSeek R1-052898.3%
DeepSeekopen
- 4Qwen3 235B-A22B98.0%
Alibabaopen
- 5QwQ-32B98.0%
Alibabaopen
- 6Nemotron Nano 9B v297.8%
NVIDIAopen
- 7Kimi K297.4%
Moonshotopen
- 8o3-mini97.3%
OpenAIclosed
- 9DeepSeek R197.3%
DeepSeekopen
- 10Qwen3 32B97.2%
Alibabaopen
- 11o197.0%
OpenAIclosed
- 12Gemini 2.5 Pro96.7%
Googleclosed
- 13Sonar Reasoning Pro95.7%
Perplexityclosed
- 14DeepSeek-R1-Distill-Llama-70B94.5%
DeepSeekopen
- 15o1 Mini94.4%
OpenAIclosed
- 16DeepSeek-R1-Distill-Qwen-32B94.3%
DeepSeekopen
- 17Qwen3 Coder 480B94.2%
Alibabaopen
- 18DeepSeek-R1 Distill Qwen 14B93.9%
DeepSeekopen
- 19GPT-4.1 Mini92.5%
OpenAIclosed
- 20o1 Preview92.4%
OpenAIclosed
- 21Sonar Reasoning92.1%
Perplexityclosed
- 22GPT-4.191.3%
OpenAIclosed
- 23DeepSeek V390.2%
DeepSeekopen
- 24Qwen3-Coder 30B-A3B89.3%
Alibabaopen
- 25Reka Flash 389.3%
Rekaopen
- 26DeepSeek-R1 Distill Llama 8B89.1%
DeepSeekopen
- 27Llama 4 Maverick88.9%
Metaopen
- 28Mistral Small 3.288.3%
Mistralopen
- 29Gemma 3 27B88.3%
Googleopen
- 30Grok 387.0%
xAIclosed
- 31Gemma 3 12B85.3%
Googleopen
- 32GPT-4.1 Nano84.8%
OpenAIclosed
- 33Llama 4 Scout84.4%
Metaopen
- 34Command A81.9%
Cohereclosed
- 35Sonar81.7%
Perplexityclosed
- 36Phi-481.0%
Microsoftopen
- 37GPT-4o (May 2024)79.1%
OpenAIclosed
- 38GPT-4o Mini78.9%
OpenAIclosed
- 39Claude 3.5 Sonnet (Oct)77.1%
Anthropicclosed
- 40Gemma 3 4B76.6%
Googleopen
- 41Sonar Pro74.5%
Perplexityclosed
- 42DeepSeek Coder V274.3%
DeepSeekopen
- 43GPT-4 Turbo73.7%
OpenAIclosed
- 44Llama-3.1-Nemotron-70B Instruct73.3%
NVIDIAopen
- 45Claude Haiku 3.572.1%
Anthropicclosed
- 46Pixtral Large71.4%
Mistralclosed
- 47Llama 3.1 405B70.3%
Metaopen
- 48Phi-4-mini69.6%
Microsoftopen
- 49Claude 3.5 Sonnet69.5%
Anthropicclosed
- 50Phi-4-multimodal69.3%
Microsoftopen
- 51Gemini 1.5 Flash-8B68.9%
Googleclosed
- 52Llama 3.1 70B64.9%
Metaopen
- 53Claude 3 Opus64.1%
Anthropicclosed
- 54Jamba 1.5 Large60.6%
AI21open
- 55GPT-456.8%
OpenAIclosed
- 56Mistral Small56.3%
Mistralclosed
- 57Mixtral 8x22B54.5%
Mistralopen
- 58Mistral Large52.7%
Mistralclosed
- 59Llama 3.1 8B51.9%
Metaopen
- 60Phi-3 Mini 3.8B45.7%
Microsoftopen
- 61GPT-3.5 Turbo44.1%
OpenAIclosed
- 62Claude 3 Sonnet41.4%
Anthropicclosed
- 63Gemini 1.0 Pro40.3%
Googleclosed
- 64Claude 3 Haiku39.4%
Anthropicclosed
- 65Claude 2.137.4%
Anthropicclosed
- 66Mixtral 8x7B29.9%
Mistralopen
- 67DBRX Instruct27.9%
Databricksopen