Coding
SWE-bench Verified
Resolves real GitHub issues in popular Python repositories (500-task human-verified subset); agent scaffold, patch budget, and test policy materially affect the result.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 39 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Claude Mythos 586.3%
Anthropicclosed
- 2Gemini 3.1 Pro80.6%
Googleclosed
- 3Qwen3.7 Max80.4%
Alibabaclosed
- 4Inkling-Small80.2%
Thinking Machinesopen
- 5Inkling77.6%
Thinking Machinesopen
- 6Kimi K2.576.8%
Moonshotopen
- 7Muse Glimmer76.0%
Metaopen
- 8MiniMax M2.575.8%
MiniMaxopen
- 9Claude Opus 4.675.6%
Anthropicclosed
- 10GPT-574.9%
OpenAIclosed
- 11Claude Opus 4.174.5%
Anthropicclosed
- 12Claude Haiku 4.573.3%
Anthropicclosed
- 13GLM-572.8%
Zhipu AIopen
- 14Nemotron 3 Ultra70.7%
NVIDIAopen
- 15DeepSeek V3.270.0%
DeepSeekopen
- 16Gemini 3 Pro69.6%
Googleclosed
- 17Kimi K265.8%
Moonshotopen
- 18gpt-oss-20B60.7%
OpenAIopen
- 19o358.4%
OpenAIclosed
- 20DeepSeek R1-052857.6%
DeepSeekopen
- 21Granite 4.2 30B57.0%
IBMopen
- 22GPT-5 Mini56.2%
OpenAIclosed
- 23GPT-5 Nano54.7%
OpenAIclosed
- 24Gemini 2.5 Pro53.6%
Googleclosed
- 25Claude 3.7 Sonnet52.8%
Anthropicclosed
- 26DeepSeek R149.2%
DeepSeekopen
- 27Granite 4.2 8B47.7%
IBMopen
- 28Devstral Small46.8%
Mistralopen
- 29o4-mini45.0%
OpenAIclosed
- 30Claude Haiku 3.540.6%
Anthropicclosed
- 31GPT-4.139.6%
OpenAIclosed
- 32Claude 3.5 Sonnet33.6%
Anthropicclosed
- 33Gemini 2.5 Flash28.7%
Googleclosed
- 34gpt-oss-120B26.0%
OpenAIopen
- 35GPT-4.1 Mini23.9%
OpenAIclosed
- 36Llama 4 Maverick21.0%
Metaopen
- 37Gemini 2.0 Flash13.5%
Googleclosed
- 38Llama 4 Scout9.1%
Metaopen
- 39Qwen2.5-Coder 32B9.0%
Alibabaopen