LLMcompare

Search

Search for a command to run...

Composite ranking

Coding

A single derived ranking across the 10 codingbenchmarks in this catalog. This is not a published benchmark score — it's computed here.

Methodology

Each eligible benchmark's scores are z-score normalized against models released in the past 12 months (since 2025-09-29), then combined as a shrunken mean: sum(z) / (n + 3), with 3 dummy average results so thin coverage still cannot dominate. Saturated benches and benches scored on fewer than ten peer models are excluded. A model needs a published score on at least 3 of the 10 benchmarks below to receive a composite; every contributing score is shown so nothing is hidden behind the composite number.

Benchmarks included
SWE-Pro, LiveCode, TermBench, TermBench 3, TermBench 4, SciCode, CursorBench, SWE-Rebench, DeepSWE, WebDev Elo
Min. coverage
3 of 10 benchmarks
Coverage
114 modelsModels in this catalog with enough published scores for a composite
Updated
Catalog snapshot date

Composite ranking

  1. 1
    Claude Fable 5.1

    Anthropicclosed6/10 benchmarks

    +0.91
    • TermBench: 91.4%
    • TermBench 4: 57.9%
    • SciCode: 63.0%
    • CursorBench: 73.4%
    • DeepSWE: 67.4%
    • WebDev Elo: 1,758
  2. 2
    Claude Opus 5

    Anthropicclosed8/10 benchmarks

    +0.89
    • TermBench: 89.1%
    • TermBench 3: 42.7%
    • TermBench 4: 51.8%
    • SciCode: 56.4%
    • CursorBench: 70.0%
    • SWE-Rebench: 63.4%
    • DeepSWE: 73.7%
    • WebDev Elo: 1,687
  3. 3
    Claude Fable 5

    Anthropicclosed9/10 benchmarks

    +0.84
    • SWE-Pro: 80.0%
    • TermBench: 84.6%
    • TermBench 3: 34.1%
    • TermBench 4: 44.6%
    • SciCode: 61.0%
    • CursorBench: 70.5%
    • SWE-Rebench: 64.5%
    • DeepSWE: 69.9%
    • WebDev Elo: 1,628
  4. 4
    Claude Mythos 5

    Anthropicclosed5/10 benchmarks

    +0.74
    • SWE-Pro: 80.0%
    • LiveCode: 88.1%
    • TermBench: 83.8%
    • TermBench 3: 34.1%
    • CursorBench: 70.5%
  5. 5
    GPT-5.6 Sol

    OpenAIclosed9/10 benchmarks

    +0.66
    • SWE-Pro: 64.6%
    • TermBench: 88.0%
    • TermBench 3: 34.6%
    • TermBench 4: 37.3%
    • SciCode: 57.1%
    • CursorBench: 67.2%
    • SWE-Rebench: 62.3%
    • DeepSWE: 72.7%
    • WebDev Elo: 1,617
  6. 6
    GPT-6 Astra

    OpenAIclosed4/10 benchmarks

    +0.60
    • TermBench: 88.4%
    • TermBench 4: 58.2%
    • SciCode: 56.0%
    • DeepSWE: 74.1%
  7. 7
    Kimi K3

    Moonshotopen5/10 benchmarks

    +0.53
    • TermBench: 85.0%
    • SciCode: 59.5%
    • CursorBench: 60.8%
    • DeepSWE: 69.0%
    • WebDev Elo: 1,674
  8. 8
    GLM-5.3

    Zhipu AIopen6/10 benchmarks

    +0.51
    • TermBench: 83.9%
    • TermBench 3: 28.3%
    • TermBench 4: 41.8%
    • SciCode: 59.0%
    • DeepSWE: 66.9%
    • WebDev Elo: 1,614
  9. 9
    Hy4 Preview

    Tencentopen4/10 benchmarks

    +0.48
    • SWE-Pro: 65.7%
    • TermBench: 85.4%
    • DeepSWE: 64.3%
    • WebDev Elo: 1,624
  10. 10
    Qwen3.8 Max

    Alibabaopen5/10 benchmarks

    +0.48
    • SWE-Pro: 67.7%
    • TermBench: 81.3%
    • SciCode: 52.1%
    • DeepSWE: 56.6%
    • WebDev Elo: 1,671
  11. 11
    Qwen3.8 Flash Next

    Alibabaopen3/10 benchmarks

    +0.47
    • TermBench: 86.1%
    • SciCode: 50.6%
    • WebDev Elo: 1,635
  12. 12
    Grok 4.6

    xAIclosed7/10 benchmarks

    +0.44
    • TermBench: 88.4%
    • TermBench 3: 26.5%
    • TermBench 4: 20.3%
    • SciCode: 56.5%
    • CursorBench: 70.8%
    • DeepSWE: 67.0%
    • WebDev Elo: 1,618
  13. 13
    Gemini 3.8 Flash

    Googleclosed6/10 benchmarks

    +0.43
    • TermBench: 87.6%
    • TermBench 4: 19.1%
    • SciCode: 56.6%
    • CursorBench: 69.2%
    • DeepSWE: 73.7%
    • WebDev Elo: 1,567
  14. 14
    Claude Opus 4.7

    Anthropicclosed5/10 benchmarks

    +0.42
    • SWE-Pro: 64.3%
    • TermBench: 83.1%
    • SciCode: 54.5%
    • SWE-Rebench: 53.1%
    • WebDev Elo: 1,557
  15. 15
    Muse Spark 1.1

    Metaclosed3/10 benchmarks

    +0.41
    • TermBench: 77.9%
    • SciCode: 58.8%
    • WebDev Elo: 1,542
  16. 16
    GLM-5.3 Flash

    Zhipu AIopen4/10 benchmarks

    +0.41
    • TermBench: 84.3%
    • SciCode: 51.6%
    • DeepSWE: 63.0%
    • WebDev Elo: 1,607
  17. 17
    GPT-5.5

    OpenAIclosed7/10 benchmarks

    +0.37
    • SWE-Pro: 58.6%
    • TermBench: 84.3%
    • SciCode: 55.8%
    • CursorBench: 58.4%
    • SWE-Rebench: 62.7%
    • DeepSWE: 67.0%
    • WebDev Elo: 1,510
  18. 18
    GPT-6 Sol

    OpenAIclosed3/10 benchmarks

    +0.36
    • TermBench 4: 44.0%
    • SciCode: 58.0%
    • DeepSWE: 68.8%
  19. 19
    Muse Spark 1.2

    Metaclosed4/10 benchmarks

    +0.31
    • TermBench: 80.1%
    • SciCode: 57.4%
    • DeepSWE: 55.0%
    • WebDev Elo: 1,535
  20. 20
    Qwen3.8 27B

    Alibabaopen6/10 benchmarks

    +0.28
    • SWE-Pro: 61.7%
    • LiveCode: 90.3%
    • TermBench: 79.8%
    • SciCode: 46.6%
    • DeepSWE: 42.2%
    • WebDev Elo: 1,593
  21. 21
    GPT-5.4

    OpenAIclosed5/10 benchmarks

    +0.26
    • SWE-Pro: 57.7%
    • TermBench: 78.3%
    • SciCode: 56.6%
    • SWE-Rebench: 57.6%
    • WebDev Elo: 1,387
  22. 22
    Claude Opus 4.8

    Anthropicclosed9/10 benchmarks

    +0.26
    • SWE-Pro: 69.2%
    • TermBench: 84.6%
    • TermBench 3: 21.1%
    • TermBench 4: 23.6%
    • SciCode: 54.4%
    • CursorBench: 62.3%
    • SWE-Rebench: 56.5%
    • DeepSWE: 59.0%
    • WebDev Elo: 1,539
  23. 23
    DeepSeek V4 Pro 0813

    DeepSeekclosed3/10 benchmarks

    +0.25
    • TermBench: 78.7%
    • SciCode: 51.0%
    • DeepSWE: 62.7%
  24. 24
    GPT-5.6 Terra

    OpenAIclosed7/10 benchmarks

    +0.24
    • SWE-Pro: 63.4%
    • TermBench: 88.0%
    • TermBench 3: 20.8%
    • TermBench 4: 21.5%
    • SciCode: 55.0%
    • CursorBench: 64.9%
    • WebDev Elo: 1,521
  25. 25
    Claude Sonnet 4.6

    Anthropicclosed4/10 benchmarks

    +0.24
    • TermBench: 71.2%
    • SciCode: 50.1%
    • SWE-Rebench: 54.5%
    • WebDev Elo: 1,521
  26. 26
    Qwen3.7 Max

    Alibabaclosed3/10 benchmarks

    +0.22
    • TermBench: 74.5%
    • SciCode: 49.5%
    • WebDev Elo: 1,517
  27. 27
    Claude Opus 4.6

    Anthropicclosed3/10 benchmarks

    +0.22
    • SciCode: 51.9%
    • SWE-Rebench: 53.3%
    • WebDev Elo: 1,537
  28. 28
    Grok 4.5

    xAIclosed6/10 benchmarks

    +0.21
    • TermBench: 81.6%
    • TermBench 3: 15.7%
    • TermBench 4: 12.4%
    • SciCode: 55.0%
    • SWE-Rebench: 63.8%
    • WebDev Elo: 1,555
  29. 29
    DeepSeek V4 Flash 0731

    DeepSeekopen3/10 benchmarks

    +0.16
    • TermBench: 78.7%
    • SciCode: 50.3%
    • DeepSWE: 54.4%
  30. 30
    Hy3

    Tencentopen3/10 benchmarks

    +0.14
    • TermBench: 64.4%
    • SciCode: 48.6%
    • WebDev Elo: 1,513
  31. 31
    Gemini 3.7 Flash

    Googleclosed7/10 benchmarks

    +0.12
    • TermBench: 85.8%
    • TermBench 3: 14.9%
    • TermBench 4: 11.2%
    • SciCode: 57.2%
    • CursorBench: 61.6%
    • DeepSWE: 65.3%
    • WebDev Elo: 1,588
  32. 32
    Gemini 3.1 Pro

    Googleclosed4/10 benchmarks

    +0.10
    • SWE-Pro: 54.2%
    • TermBench: 70.7%
    • SWE-Rebench: 54.9%
    • WebDev Elo: 1,447
  33. 33
    Nemotron 3 Ultra

    NVIDIAopen3/10 benchmarks

    +0.09
    • LiveCode: 89.0%
    • TermBench: 56.4%
    • SciCode: 40.3%
  34. 34
    Kimi K2.6

    Moonshotclosed4/10 benchmarks

    +0.08
    • TermBench: 65.9%
    • SciCode: 51.5%
    • SWE-Rebench: 46.5%
    • WebDev Elo: 1,509
  35. 35
    GLM-5.1

    Zhipu AIopen3/10 benchmarks

    +0.06
    • TermBench: 61.8%
    • SciCode: 44.8%
    • WebDev Elo: 1,508
  36. 36
    Gemini 3 Pro

    Googleclosed3/10 benchmarks

    +0.05
    • TermBench: 73.9%
    • SWE-Rebench: 50.7%
    • WebDev Elo: 1,439
  37. 37
    MiniMax M3

    MiniMaxopen5/10 benchmarks

    +0.04
    • SWE-Pro: 59.0%
    • TermBench: 65.2%
    • SciCode: 47.1%
    • SWE-Rebench: 46.4%
    • WebDev Elo: 1,487
  38. 38
    GPT-6 Luna

    OpenAIclosed3/10 benchmarks

    +0.03
    • TermBench 4: 13.0%
    • SciCode: 55.0%
    • DeepSWE: 66.6%
  39. 39
    Claude Sonnet 5

    Anthropicclosed8/10 benchmarks

    +0.03
    • TermBench: 80.5%
    • TermBench 3: 14.6%
    • TermBench 4: 12.4%
    • SciCode: 54.3%
    • CursorBench: 61.5%
    • SWE-Rebench: 56.8%
    • DeepSWE: 54.0%
    • WebDev Elo: 1,537
  40. 40
    Kimi K2.5

    Moonshotopen5/10 benchmarks

    +0.03
    • SWE-Pro: 50.7%
    • LiveCode: 85.0%
    • TermBench: 45.7%
    • SciCode: 49.0%
    • SWE-Rebench: 49.0%
  41. 41
    GPT-5.4 Nano

    OpenAIclosed3/10 benchmarks

    +0.02
    • SWE-Pro: 52.4%
    • TermBench: 60.7%
    • SciCode: 47.2%
  42. 42
    GPT-5.6 Luna

    OpenAIclosed9/10 benchmarks

    +0.02
    • SWE-Pro: 62.7%
    • TermBench: 80.9%
    • TermBench 3: 14.3%
    • TermBench 4: 17.3%
    • SciCode: 53.6%
    • CursorBench: 61.1%
    • SWE-Rebench: 43.6%
    • DeepSWE: 67.0%
    • WebDev Elo: 1,519
  43. 43
    Qwen3.5 397B-A17B

    Alibabaopen4/10 benchmarks

    +0.01
    • TermBench: 51.3%
    • SciCode: 44.8%
    • SWE-Rebench: 59.9%
    • WebDev Elo: 1,399
  44. 44
    GPT-5.4 Mini

    OpenAIclosed4/10 benchmarks

    +0.01
    • SWE-Pro: 54.4%
    • TermBench: 59.2%
    • SciCode: 52.1%
    • WebDev Elo: 1,397
  45. 45
    GLM-5

    Zhipu AIopen3/10 benchmarks

    +0.01
    • SciCode: 46.2%
    • SWE-Rebench: 53.3%
    • WebDev Elo: 1,436
  46. 46
    Claude Opus 4.5

    Anthropicclosed4/10 benchmarks

    -0.00
    • SWE-Pro: 45.9%
    • SciCode: 49.5%
    • SWE-Rebench: 53.1%
    • WebDev Elo: 1,468
  47. 47
    MiMo-V2.5-Pro

    Xiaomiopen4/10 benchmarks

    -0.00
    • TermBench: 65.2%
    • SciCode: 50.6%
    • SWE-Rebench: 44.4%
    • WebDev Elo: 1,475
  48. 48
    Gemini 3.6 Flash

    Googleclosed5/10 benchmarks

    -0.00
    • TermBench: 77.5%
    • SciCode: 53.4%
    • CursorBench: 53.5%
    • DeepSWE: 47.0%
    • WebDev Elo: 1,537
  49. 49
    MiniMax M2.7

    MiniMaxclosed5/10 benchmarks

    -0.01
    • SWE-Pro: 56.2%
    • TermBench: 55.4%
    • SciCode: 50.1%
    • SWE-Rebench: 51.9%
    • WebDev Elo: 1,398
  50. 50
    Inkling-Small

    Thinking Machinesopen4/10 benchmarks

    -0.02
    • SWE-Pro: 55.9%
    • TermBench: 55.1%
    • SciCode: 49.7%
    • WebDev Elo: 1,407
  51. 51
    MiMo-V2.5

    Xiaomiopen3/10 benchmarks

    -0.03
    • TermBench: 63.7%
    • SciCode: 43.9%
    • WebDev Elo: 1,437
  52. 52
    Ling-3.0 Flash

    InclusionAIopen3/10 benchmarks

    -0.04
    • SWE-Pro: 56.6%
    • TermBench: 55.4%
    • SciCode: 42.0%
  53. 53
    Qwen3.6 Plus

    Alibabaclosed3/10 benchmarks

    -0.07
    • TermBench: 61.4%
    • SciCode: 40.7%
    • WebDev Elo: 1,461
  54. 54
    Inkling

    Thinking Machinesopen4/10 benchmarks

    -0.07
    • SWE-Pro: 54.3%
    • TermBench: 55.1%
    • SciCode: 47.0%
    • WebDev Elo: 1,410
  55. 55
    GLM-5.2

    Zhipu AIopen7/10 benchmarks

    -0.09
    • TermBench: 77.9%
    • TermBench 3: 4.6%
    • SciCode: 51.2%
    • CursorBench: 55.0%
    • SWE-Rebench: 57.0%
    • DeepSWE: 44.0%
    • WebDev Elo: 1,592
  56. 56
    Grok 4

    xAIclosed3/10 benchmarks

    -0.10
    • LiveCode: 81.9%
    • SciCode: 45.7%
    • SWE-Rebench: 38.3%
  57. 57
    Gemini 3.5 Flash-Lite

    Googleclosed3/10 benchmarks

    -0.13
    • TermBench: 53.6%
    • SciCode: 41.3%
    • WebDev Elo: 1,447
  58. 58
    Solar Pro 4

    Upstageclosed3/10 benchmarks

    -0.15
    • TermBench: 57.3%
    • SciCode: 44.6%
    • WebDev Elo: 1,372
  59. 59
    Kimi K2.7 Code

    Moonshotopen4/10 benchmarks

    -0.18
    • TermBench: 67.4%
    • SciCode: 47.8%
    • CursorBench: 49.7%
    • WebDev Elo: 1,473
  60. 60
    o3

    OpenAIclosed3/10 benchmarks

    -0.19
    • LiveCode: 80.8%
    • SciCode: 41.0%
    • SWE-Rebench: 38.1%
  61. 61
    Muse Glimmer

    Metaopen4/10 benchmarks

    -0.20
    • SWE-Pro: 51.2%
    • TermBench: 51.7%
    • SciCode: 44.9%
    • WebDev Elo: 1,360
  62. 62
    Gemini 3.5 Flash

    Googleclosed6/10 benchmarks

    -0.20
    • TermBench: 78.7%
    • SciCode: 53.9%
    • CursorBench: 48.8%
    • SWE-Rebench: 49.5%
    • DeepSWE: 36.0%
    • WebDev Elo: 1,492
  63. 63
    Claude Sonnet 4.5

    Anthropicclosed3/10 benchmarks

    -0.21
    • SWE-Pro: 43.6%
    • SWE-Rebench: 52.4%
    • WebDev Elo: 1,386
  64. 64
    GLM-4.7

    Zhipu AIopen4/10 benchmarks

    -0.21
    • TermBench: 45.3%
    • SciCode: 45.1%
    • SWE-Rebench: 45.5%
    • WebDev Elo: 1,435
  65. 65
    MiniMax M2.5

    MiniMaxopen3/10 benchmarks

    -0.22
    • SciCode: 42.6%
    • SWE-Rebench: 47.7%
    • WebDev Elo: 1,384
  66. 66
    Grok 4.3

    xAIclosed3/10 benchmarks

    -0.23
    • TermBench: 39.7%
    • SciCode: 48.3%
    • WebDev Elo: 1,357
  67. 67
    Claude Sonnet 4

    Anthropicclosed3/10 benchmarks

    -0.28
    • SWE-Pro: 42.7%
    • LiveCode: 59.4%
    • SWE-Rebench: 44.6%
  68. 68
    GPT-5

    OpenAIclosed3/10 benchmarks

    -0.34
    • SWE-Pro: 41.8%
    • TermBench: 35.2%
    • SciCode: 42.9%
  69. 69
    Mistral Medium 3.5

    Mistralopen3/10 benchmarks

    -0.39
    • TermBench: 50.6%
    • SciCode: 40.2%
    • WebDev Elo: 1,265
  70. 70
    Granite 4.2 30B

    IBMopen4/10 benchmarks

    -0.41
    • SWE-Pro: 33.3%
    • LiveCode: 75.8%
    • TermBench: 26.6%
    • SciCode: 37.8%
  71. 71
    DeepSeek V4 Pro

    DeepSeekopen5/10 benchmarks

    -0.42
    • TermBench: 64.0%
    • SciCode: 50.8%
    • SWE-Rebench: 41.4%
    • DeepSWE: 12.8%
    • WebDev Elo: 1,446
  72. 72
    DeepSeek V3.1

    DeepSeekopen3/10 benchmarks

    -0.44
    • LiveCode: 74.8%
    • SciCode: 39.1%
    • SWE-Rebench: 28.0%
  73. 73
    DeepSeek V4 Flash

    DeepSeekopen5/10 benchmarks

    -0.45
    • TermBench: 61.8%
    • SciCode: 45.3%
    • SWE-Rebench: 38.4%
    • DeepSWE: 7.3%
    • WebDev Elo: 1,580
  74. 74
    Gemma 4 31B

    Googleopen5/10 benchmarks

    -0.46
    • LiveCode: 80.0%
    • TermBench: 43.4%
    • SciCode: 45.5%
    • SWE-Rebench: 25.1%
    • WebDev Elo: 1,364
  75. 75
    DeepSeek V3.2

    DeepSeekopen6/10 benchmarks

    -0.46
    • SWE-Pro: 15.6%
    • LiveCode: 86.2%
    • TermBench: 46.8%
    • SciCode: 38.9%
    • SWE-Rebench: 48.9%
    • WebDev Elo: 1,325
  76. 76
    DeepSeek R1-0528

    DeepSeekopen3/10 benchmarks

    -0.46
    • LiveCode: 84.4%
    • SciCode: 40.3%
    • SWE-Rebench: 22.3%
  77. 77
    Gemini 3.1 Flash-Lite

    Googleclosed3/10 benchmarks

    -0.49
    • TermBench: 31.1%
    • SciCode: 43.4%
    • WebDev Elo: 1,254
  78. 78
    Qwen3 Coder 480B

    Alibabaopen4/10 benchmarks

    -0.54
    • SWE-Pro: 38.7%
    • LiveCode: 58.5%
    • SciCode: 35.9%
    • SWE-Rebench: 36.3%
  79. 79
    Gemini 2.5 Flash

    Googleclosed3/10 benchmarks

    -0.59
    • LiveCode: 75.1%
    • SciCode: 39.4%
    • SWE-Rebench: 19.9%
  80. 80
    Claude 3.5 Sonnet

    Anthropicclosed3/10 benchmarks

    -0.62
    • LiveCode: 48.7%
    • SciCode: 36.6%
    • SWE-Rebench: 30.3%
  81. 81
    GPT-4.1

    OpenAIclosed3/10 benchmarks

    -0.62
    • LiveCode: 45.7%
    • SciCode: 38.1%
    • SWE-Rebench: 30.1%
  82. 82
    Trinity Large Thinking

    Arcee AIopen3/10 benchmarks

    -0.62
    • TermBench: 20.6%
    • SciCode: 40.6%
    • WebDev Elo: 1,237
  83. 83
    Mistral Medium 3.1

    Mistralclosed3/10 benchmarks

    -0.65
    • LiveCode: 40.6%
    • TermBench: 13.9%
    • SciCode: 32.4%
  84. 84
    Gemini 2.5 Pro

    Googleclosed5/10 benchmarks

    -0.68
    • LiveCode: 80.1%
    • TermBench: 28.5%
    • SciCode: 46.3%
    • SWE-Rebench: 23.5%
    • WebDev Elo: 1,226
  85. 85
    Granite 4.2 8B

    IBMopen4/10 benchmarks

    -0.69
    • SWE-Pro: 19.1%
    • LiveCode: 73.2%
    • TermBench: 18.4%
    • SciCode: 31.5%
  86. 86
    Mercury 2

    Inception Labsclosed3/10 benchmarks

    -0.71
    • TermBench: 27.3%
    • SciCode: 37.7%
    • WebDev Elo: 1,167
  87. 87
    Kimi K2

    Moonshotopen4/10 benchmarks

    -0.72
    • SWE-Pro: 27.7%
    • LiveCode: 53.7%
    • SciCode: 34.5%
    • SWE-Rebench: 34.6%
  88. 88
    Mistral Large 3

    Mistralopen4/10 benchmarks

    -0.74
    • LiveCode: 46.5%
    • TermBench: 12.0%
    • SciCode: 36.6%
    • WebDev Elo: 1,230
  89. 89
    Devstral 2

    Mistralopen5/10 benchmarks

    -0.77
    • LiveCode: 44.8%
    • TermBench: 30.3%
    • SciCode: 32.8%
    • SWE-Rebench: 42.0%
    • WebDev Elo: 1,194
  90. 90
    Claude Haiku 3.5

    Anthropicclosed3/10 benchmarks

    -0.81
    • LiveCode: 31.4%
    • TermBench: 10.1%
    • SciCode: 27.4%
  91. 91
    Qwen3 235B-A22B

    Alibabaopen4/10 benchmarks

    -0.81
    • SWE-Pro: 21.4%
    • LiveCode: 80.4%
    • SciCode: 39.9%
    • SWE-Rebench: 18.5%
  92. 92
    GPT-4.1 Mini

    OpenAIclosed4/10 benchmarks

    -0.84
    • LiveCode: 48.3%
    • TermBench: 10.1%
    • SciCode: 40.4%
    • SWE-Rebench: 25.5%
  93. 93
    Ministral 3 14B

    Mistralopen3/10 benchmarks

    -0.84
    • LiveCode: 35.1%
    • TermBench: 9.7%
    • SciCode: 23.8%
  94. 94
    Mistral Small 3.2

    Mistralopen3/10 benchmarks

    -0.85
    • LiveCode: 27.5%
    • TermBench: 5.6%
    • SciCode: 28.6%
  95. 95
    GPT-4o Mini

    OpenAIclosed3/10 benchmarks

    -0.88
    • LiveCode: 35.5%
    • TermBench: 5.6%
    • SciCode: 22.9%
  96. 96
    DeepSeek V3

    DeepSeekopen4/10 benchmarks

    -0.88
    • LiveCode: 49.6%
    • TermBench: 16.9%
    • SciCode: 35.8%
    • SWE-Rebench: 23.3%
  97. 97
    Qwen3-Next 80B-A3B

    Alibabaopen4/10 benchmarks

    -0.91
    • LiveCode: 56.6%
    • TermBench: 6.7%
    • SciCode: 38.8%
    • SWE-Rebench: 20.1%
  98. 98
    Ministral 3 8B

    Mistralopen3/10 benchmarks

    -0.95
    • LiveCode: 30.3%
    • TermBench: 4.1%
    • SciCode: 20.7%
  99. 99
    Qwen3-Coder 30B-A3B

    Alibabaopen3/10 benchmarks

    -0.97
    • LiveCode: 40.3%
    • SciCode: 27.8%
    • SWE-Rebench: 21.6%
  100. 100
    Llama 3.1 405B

    Metaopen3/10 benchmarks

    -0.97
    • SWE-Pro: 11.2%
    • LiveCode: 27.7%
    • SciCode: 29.9%
  101. 101
    Granite 4.1 8B

    IBMopen3/10 benchmarks

    -1.07
    • TermBench: 3.4%
    • SciCode: 21.8%
    • WebDev Elo: 1,192
  102. 102
    Gemma 3 12B

    Googleopen3/10 benchmarks

    -1.08
    • LiveCode: 24.6%
    • TermBench: 0.0%
    • SciCode: 16.4%
  103. 103
    gpt-oss-120B

    OpenAIopen4/10 benchmarks

    -1.09
    • SWE-Pro: 16.2%
    • TermBench: 26.2%
    • SciCode: 34.0%
    • SWE-Rebench: 27.3%
  104. 104
    Qwen3 32B

    Alibabaopen4/10 benchmarks

    -1.10
    • LiveCode: 65.7%
    • TermBench: 5.2%
    • SciCode: 36.0%
    • SWE-Rebench: 8.1%
  105. 105
    Ministral 3 3B

    Mistralopen3/10 benchmarks

    -1.10
    • LiveCode: 24.7%
    • TermBench: 0.0%
    • SciCode: 15.3%
  106. 106
    gpt-oss-20B

    OpenAIopen3/10 benchmarks

    -1.19
    • TermBench: 13.9%
    • SciCode: 38.9%
    • SWE-Rebench: 8.1%
  107. 107
    Llama 3.1 8B

    Metaopen3/10 benchmarks

    -1.21
    • LiveCode: 11.6%
    • TermBench: 1.5%
    • SciCode: 13.2%
  108. 108
    Phi-4-mini

    Microsoftopen3/10 benchmarks

    -1.25
    • LiveCode: 12.6%
    • TermBench: 0.4%
    • SciCode: 10.8%
  109. 109
    Gemma 3 4B

    Googleopen3/10 benchmarks

    -1.30
    • LiveCode: 12.6%
    • TermBench: 0.4%
    • SciCode: 7.3%
  110. 110
    Llama 3.3 70B

    Metaopen3/10 benchmarks

    -1.31
    • LiveCode: 33.3%
    • TermBench: 4.9%
    • SWE-Rebench: 11.5%
  111. 111
    Llama 4 Maverick

    Metaopen5/10 benchmarks

    -1.49
    • SWE-Pro: 5.2%
    • LiveCode: 43.4%
    • TermBench: 7.9%
    • SciCode: 31.7%
    • SWE-Rebench: 11.0%
  112. 112
    Llama 4 Scout

    Metaopen4/10 benchmarks

    -1.51
    • LiveCode: 32.8%
    • TermBench: 3.7%
    • SciCode: 21.3%
    • SWE-Rebench: 6.6%
  113. 113
    GPT-4.1 Nano

    OpenAIclosed4/10 benchmarks

    -1.55
    • LiveCode: 32.6%
    • TermBench: 3.7%
    • SciCode: 25.9%
    • SWE-Rebench: 0.3%
  114. 114
    Gemma 3 27B

    Googleopen5/10 benchmarks

    -1.70
    • SWE-Pro: 11.4%
    • LiveCode: 29.7%
    • TermBench: 4.5%
    • SciCode: 23.3%
    • SWE-Rebench: 5.4%

Back to Coding benchmarks