Coding
SWE-Rebench
Contamination-resistant software engineering: rolling window of fresh GitHub issues under a fixed ReAct agent scaffold; scores are tied to the published task window.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 64 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
- Source
- swe-rebench.com/
Scores
- 1Claude Fable 564.5%
Anthropicclosed
- 2Grok 4.563.8%
xAIclosed
- 3Claude Opus 563.4%
Anthropicclosed
- 4GPT-5.562.7%
OpenAIclosed
- 5GPT-5.6 Sol62.3%
OpenAIclosed
- 6Qwen3.5 397B-A17B59.9%
Alibabaopen
- 7Step-3.5 Flash59.6%
StepFunclosed
- 8GPT-5.457.6%
OpenAIclosed
- 9GLM-5.257.0%
Zhipu AIopen
- 10Claude Sonnet 556.8%
Anthropicclosed
- 11Claude Opus 4.856.5%
Anthropicclosed
- 12Gemini 3.1 Pro54.9%
Googleclosed
- 13Claude Sonnet 4.654.5%
Anthropicclosed
- 14GLM-553.3%
Zhipu AIopen
- 15Claude Opus 4.653.3%
Anthropicclosed
- 16Claude Opus 4.553.1%
Anthropicclosed
- 17Claude Opus 4.753.1%
Anthropicclosed
- 18Claude Sonnet 4.552.4%
Anthropicclosed
- 19MiniMax M2.751.9%
MiniMaxclosed
- 20Gemini 3 Pro50.7%
Googleclosed
- 21Gemini 3.5 Flash49.5%
Googleclosed
- 22Kimi K2.549.0%
Moonshotopen
- 23DeepSeek V3.248.9%
DeepSeekopen
- 24MiniMax M2.547.7%
MiniMaxopen
- 25Kimi K2.646.5%
Moonshotclosed
- 26MiniMax M346.4%
MiniMaxopen
- 27GLM-4.745.5%
Zhipu AIopen
- 28Claude Sonnet 444.6%
Anthropicclosed
- 29MiMo-V2.5-Pro44.4%
Xiaomiopen
- 30GPT-5.6 Luna43.6%
OpenAIclosed
- 31Claude Opus 4.143.5%
Anthropicclosed
- 32Devstral 242.0%
Mistralopen
- 33DeepSeek V4 Pro41.4%
DeepSeekopen
- 34DeepSeek V4 Flash38.4%
DeepSeekopen
- 35Grok 438.3%
xAIclosed
- 36o338.1%
OpenAIclosed
- 37Qwen3 Coder 480B36.3%
Alibabaopen
- 38Kimi K234.6%
Moonshotopen
- 39Claude 3.5 Sonnet30.3%
Anthropicclosed
- 40GPT-4.130.1%
OpenAIclosed
- 41GLM-4.7 Flash30.1%
Zhipu AIclosed
- 42DeepSeek V3.128.0%
DeepSeekopen
- 43o4-mini27.5%
OpenAIclosed
- 44gpt-oss-120B27.3%
OpenAIopen
- 45GPT-4.1 Mini25.5%
OpenAIclosed
- 46Gemma 4 31B25.1%
Googleopen
- 47Gemini 2.5 Pro23.5%
Googleclosed
- 48DeepSeek V323.3%
DeepSeekopen
- 49DeepSeek R1-052822.3%
DeepSeekopen
- 50Qwen3-Coder 30B-A3B21.6%
Alibabaopen
- 51Qwen3-Next 80B-A3B20.1%
Alibabaopen
- 52Gemini 2.5 Flash19.9%
Googleclosed
- 53Qwen3 235B-A22B18.5%
Alibabaopen
- 54Devstral Small14.6%
Mistralopen
- 55Llama 3.3 70B11.5%
Metaopen
- 56Llama 4 Maverick11.0%
Metaopen
- 57Qwen2.5 72B10.1%
Alibabaopen
- 58Gemini 2.0 Flash9.1%
Googleclosed
- 59Qwen3 32B8.1%
Alibabaopen
- 60gpt-oss-20B8.1%
OpenAIopen
- 61Llama 4 Scout6.6%
Metaopen
- 62Gemma 3 27B5.4%
Googleopen
- 63Qwen2.5-Coder 32B3.1%
Alibabaopen
- 64GPT-4.1 Nano0.3%
OpenAIclosed