Coding
SWE-bench Pro
Long-horizon repository engineering across 1,865 tasks from 41 professional codebases; leaderboard results are agent-system scores, not model-only capability scores.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 40 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Claude Fable 580.0%
Anthropicclosed
- 2Claude Mythos 580.0%
Anthropicclosed
- 3Claude Opus 4.869.2%
Anthropicclosed
- 4Qwen3.8 Max67.7%
Alibabaopen
- 5Hy4 Preview65.7%
Tencentopen
- 6GPT-5.6 Sol64.6%
OpenAIclosed
- 7Claude Opus 4.764.3%
Anthropicclosed
- 8GPT-5.6 Terra63.4%
OpenAIclosed
- 9GPT-5.6 Luna62.7%
OpenAIclosed
- 10Qwen3.8 27B61.7%
Alibabaopen
- 11Atria Dawn Preview59.6%
Shanghai AI Labopen
- 12MiniMax M359.0%
MiniMaxopen
- 13GPT-5.558.6%
OpenAIclosed
- 14GPT-5.457.7%
OpenAIclosed
- 15Ling-3.0 Flash56.6%
InclusionAIopen
- 16MiniMax M2.756.2%
MiniMaxclosed
- 17Inkling-Small55.9%
Thinking Machinesopen
- 18GPT-5.4 Mini54.4%
OpenAIclosed
- 19Inkling54.3%
Thinking Machinesopen
- 20Gemini 3.1 Pro54.2%
Googleclosed
- 21GPT-5.4 Nano52.4%
OpenAIclosed
- 22Muse Glimmer51.2%
Metaopen
- 23Kimi K2.550.7%
Moonshotopen
- 24Seed 2.0 Pro46.9%
ByteDanceclosed
- 25Claude Opus 4.545.9%
Anthropicclosed
- 26Claude Sonnet 4.543.6%
Anthropicclosed
- 27Claude Sonnet 442.7%
Anthropicclosed
- 28GPT-541.8%
OpenAIclosed
- 29Claude Haiku 4.539.5%
Anthropicclosed
- 30Qwen3 Coder 480B38.7%
Alibabaopen
- 31Gemini 3 Flash34.6%
Googleclosed
- 32Granite 4.2 30B33.3%
IBMopen
- 33Kimi K227.7%
Moonshotopen
- 34Qwen3 235B-A22B21.4%
Alibabaopen
- 35Granite 4.2 8B19.1%
IBMopen
- 36gpt-oss-120B16.2%
OpenAIopen
- 37DeepSeek V3.215.6%
DeepSeekopen
- 38Gemma 3 27B11.4%
Googleopen
- 39Llama 3.1 405B11.2%
Metaopen
- 40Llama 4 Maverick5.2%
Metaopen