LLMcompare

Search

Search for a command to run...

Coding

Aider Polyglot

Multi-language coding agent benchmark: edit existing codebases to pass unit tests across languages; score depends on the Aider model prompt and edit strategy.

How models are tested

Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.

Category
Coding
Metric
Percent
Direction
Higher is better
Coverage
35 / 318Models in this catalog with a published score
Updated
Catalog snapshot date

Scores

  1. 1
    GPT-5

    OpenAIclosed

    88.0%
  2. 2
    o3-pro

    OpenAIclosed

    84.9%
  3. 3
    o3

    OpenAIclosed

    81.3%
  4. 4
    Grok 4

    xAIclosed

    79.6%
  5. 5
    Gemini 2.5 Pro

    Googleclosed

    79.1%
  6. 6
    DeepSeek V3.1

    DeepSeekopen

    76.3%
  7. 7
    GPT-5 Mini

    OpenAIclosed

    71.6%
  8. 8
    DeepSeek R1-0528

    DeepSeekopen

    71.4%
  9. 9
    Claude Opus 4

    Anthropicclosed

    70.7%
  10. 10
    o1

    OpenAIclosed

    61.7%
  11. 11
    Claude 3.7 Sonnet

    Anthropicclosed

    60.4%
  12. 12
    Qwen3 235B-A22B

    Alibabaopen

    59.6%
  13. 13
    Kimi K2

    Moonshotopen

    59.1%
  14. 14
    o4-mini

    OpenAIclosed

    58.2%
  15. 15
    DeepSeek R1

    DeepSeekopen

    56.9%
  16. 16
    Claude Sonnet 4

    Anthropicclosed

    56.4%
  17. 17
    DeepSeek V3

    DeepSeekopen

    55.1%
  18. 18
    o3-mini

    OpenAIclosed

    53.8%
  19. 19
    Grok 3

    xAIclosed

    53.3%
  20. 20
    GPT-4.1

    OpenAIclosed

    52.4%
  21. 2151.6%
  22. 2249.8%
  23. 23
    GPT-5 Nano

    OpenAIclosed

    48.4%
  24. 24
    GPT-4.5

    OpenAIclosed

    44.9%
  25. 25
    gpt-oss-120B

    OpenAIopen

    41.8%
  26. 26
    Qwen3 32B

    Alibabaopen

    40.0%
  27. 27
    gpt-oss-20B

    OpenAIopen

    34.2%
  28. 28
    o1 Mini

    OpenAIclosed

    32.9%
  29. 29
    GPT-4.1 Mini

    OpenAIclosed

    32.4%
  30. 30
    QwQ-32B

    Alibabaopen

    20.9%
  31. 3115.6%
  32. 32
    Yi Lightning

    01.AIclosed

    12.9%
  33. 33
    GPT-4.1 Nano

    OpenAIclosed

    8.9%
  34. 34
    Gemma 3 27B

    Googleopen

    4.9%
  35. 35
    GPT-4o Mini

    OpenAIclosed

    3.6%

Back to all benchmarks