Reasoning & knowledge
AIME 2025
American Invitational Mathematics Examination 2025 — contest math problems testing multi-step reasoning; model reports may differ by answer format and sampling setup.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Reasoning & knowledge
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 65 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
- Source
- matharena.ai/
Scores
- 1Claude Mythos 597.0%
Anthropicclosed
- 2Kimi K2.596.1%
Moonshotopen
- 3GPT-594.6%
OpenAIclosed
- 4Grok 492.7%
xAIclosed
- 5o4-mini92.7%
OpenAIclosed
- 6gpt-oss-120B92.5%
OpenAIopen
- 7DeepSeek V3.292.0%
DeepSeekopen
- 8gpt-oss-20B91.7%
OpenAIopen
- 9GPT-5 Mini91.1%
OpenAIclosed
- 10Granite 4.2 30B89.2%
IBMopen
- 11Nemotron Nano 3 30B89.1%
NVIDIAopen
- 12o388.9%
OpenAIclosed
- 13DeepSeek V3.188.4%
DeepSeekopen
- 14Gemini 2.5 Pro87.7%
Googleclosed
- 15DeepSeek R1-052887.5%
DeepSeekopen
- 16Granite 4.2 8B86.7%
IBMopen
- 17GPT-5 Nano85.2%
OpenAIclosed
- 18Qwen3 235B-A22B81.5%
Alibabaopen
- 19Qwen3 Max80.7%
Alibabaclosed
- 20o1 Preview79.3%
OpenAIclosed
- 21OLMo 3 32B Think73.7%
Ai2open
- 22Qwen3 32B72.9%
Alibabaopen
- 23Nemotron Nano 9B v272.1%
NVIDIAopen
- 24DeepSeek R170.0%
DeepSeekopen
- 25QwQ-32B69.5%
Alibabaopen
- 26Qwen3-Next 80B-A3B69.5%
Alibabaopen
- 27DeepSeek-R1-Distill-Qwen-32B63.0%
DeepSeekopen
- 28Phi-4 Reasoning62.9%
Microsoftopen
- 29Magistral Small62.8%
Mistralopen
- 30Grok 358.0%
xAIclosed
- 31DeepSeek-R1 Distill Qwen 14B55.7%
DeepSeekopen
- 32DeepSeek-R1-Distill-Llama-70B53.7%
DeepSeekopen
- 33Kimi K249.5%
Moonshotopen
- 34GPT-4.146.4%
OpenAIclosed
- 35DeepSeek-R1 Distill Llama 8B41.3%
DeepSeekopen
- 36GPT-4.1 Mini40.2%
OpenAIclosed
- 37Qwen3 Coder 480B39.3%
Alibabaopen
- 38Mistral Medium 3.138.3%
Mistralclosed
- 39Mistral Large 338.0%
Mistralopen
- 40Devstral 236.7%
Mistralopen
- 41Reka Flash 333.7%
Rekaopen
- 42Ministral 3 8B31.7%
Mistralopen
- 43Ministral 3 14B30.0%
Mistralopen
- 44Qwen3-Coder 30B-A3B29.0%
Alibabaopen
- 45Mistral Small 3.227.0%
Mistralopen
- 46DeepSeek V326.0%
DeepSeekopen
- 47GPT-4.1 Nano24.0%
OpenAIclosed
- 48Ministral 3 3B22.0%
Mistralopen
- 49Gemma 3 27B20.7%
Googleopen
- 50Llama 4 Maverick19.3%
Metaopen
- 51Gemma 3 12B18.3%
Googleopen
- 52Phi-418.0%
Microsoftopen
- 53GPT-4o Mini14.7%
OpenAIclosed
- 54Llama 4 Scout14.0%
Metaopen
- 55Command A13.0%
Cohereclosed
- 56Gemma 3 4B12.7%
Googleopen
- 57Llama-3.1-Nemotron-70B Instruct11.0%
NVIDIAopen
- 58Phi-4-mini6.7%
Microsoftopen
- 59Granite 4.0 Micro6.0%
IBMopen
- 60Llama 3.1 8B4.3%
Metaopen
- 61Llama 3.1 70B4.0%
Metaopen
- 62OLMo 2 32B3.3%
Ai2open
- 63Llama 3.1 405B3.0%
Metaopen
- 64Pixtral Large2.3%
Mistralclosed
- 65Phi-3 Mini 3.8B0.3%
Microsoftopen