Coding
Aider Polyglot
Multi-language coding agent benchmark: edit existing codebases to pass unit tests across languages; score depends on the Aider model prompt and edit strategy.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 35 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1GPT-588.0%
OpenAIclosed
- 2o3-pro84.9%
OpenAIclosed
- 3o381.3%
OpenAIclosed
- 4Grok 479.6%
xAIclosed
- 5Gemini 2.5 Pro79.1%
Googleclosed
- 6DeepSeek V3.176.3%
DeepSeekopen
- 7GPT-5 Mini71.6%
OpenAIclosed
- 8DeepSeek R1-052871.4%
DeepSeekopen
- 9Claude Opus 470.7%
Anthropicclosed
- 10o161.7%
OpenAIclosed
- 11Claude 3.7 Sonnet60.4%
Anthropicclosed
- 12Qwen3 235B-A22B59.6%
Alibabaopen
- 13Kimi K259.1%
Moonshotopen
- 14o4-mini58.2%
OpenAIclosed
- 15DeepSeek R156.9%
DeepSeekopen
- 16Claude Sonnet 456.4%
Anthropicclosed
- 17DeepSeek V355.1%
DeepSeekopen
- 18o3-mini53.8%
OpenAIclosed
- 19Grok 353.3%
xAIclosed
- 20GPT-4.152.4%
OpenAIclosed
- 21Claude 3.5 Sonnet (Oct)51.6%
Anthropicclosed
- 22Qwen3-Next 80B-A3B49.8%
Alibabaopen
- 23GPT-5 Nano48.4%
OpenAIclosed
- 24GPT-4.544.9%
OpenAIclosed
- 25gpt-oss-120B41.8%
OpenAIopen
- 26Qwen3 32B40.0%
Alibabaopen
- 27gpt-oss-20B34.2%
OpenAIopen
- 28o1 Mini32.9%
OpenAIclosed
- 29GPT-4.1 Mini32.4%
OpenAIclosed
- 30QwQ-32B20.9%
Alibabaopen
- 31Llama 4 Maverick15.6%
Metaopen
- 32Yi Lightning12.9%
01.AIclosed
- 33GPT-4.1 Nano8.9%
OpenAIclosed
- 34Gemma 3 27B4.9%
Googleopen
- 35GPT-4o Mini3.6%
OpenAIclosed