LLMcompare

Search

Search for a command to run...

Coding

Terminal-Bench 2.1

Terminal-Bench 2.1 contains 89 agentic terminal tasks. Scores are agent-system results and vary with harness, effort level, timeout, resource allocation, task revision, and evaluation date; they are not model-only measurements.

How models are tested

Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.

Category
Coding
Metric
Percent
Direction
Higher is better
Coverage
110 / 318Models in this catalog with a published score
Updated
Catalog snapshot date

Scores

  1. 1
    Claude Fable 5.1

    Anthropicclosed

    91.4%
  2. 2
    Claude Opus 5

    Anthropicclosed

    89.1%
  3. 3
    GPT-6 Astra

    OpenAIclosed

    88.4%
  4. 4
    Grok 4.6

    xAIclosed

    88.4%
  5. 5
    GPT-5.6 Sol

    OpenAIclosed

    88.0%
  6. 6
    GPT-5.6 Terra

    OpenAIclosed

    88.0%
  7. 7
    Gemini 3.8 Flash

    Googleclosed

    87.6%
  8. 886.1%
  9. 9
    Gemini 3.7 Flash

    Googleclosed

    85.8%
  10. 10
    Muse Spark 1.3

    Metaclosed

    85.8%
  11. 11
    Hy4 Preview

    Tencentopen

    85.4%
  12. 12
    Kimi K3

    Moonshotopen

    85.0%
  13. 13
    Claude Fable 5

    Anthropicclosed

    84.6%
  14. 14
    Claude Opus 4.8

    Anthropicclosed

    84.6%
  15. 15
    GPT-5.5

    OpenAIclosed

    84.3%
  16. 16
    GLM-5.3 Flash

    Zhipu AIopen

    84.3%
  17. 17
    GLM-5.3

    Zhipu AIopen

    83.9%
  18. 18
    Claude Mythos 5

    Anthropicclosed

    83.8%
  19. 19
    Claude Opus 4.7

    Anthropicclosed

    83.1%
  20. 20
    Grok 4.5

    xAIclosed

    81.6%
  21. 21
    Qwen3.8 Max

    Alibabaopen

    81.3%
  22. 22
    GPT-5.6 Luna

    OpenAIclosed

    80.9%
  23. 23
    Claude Sonnet 5

    Anthropicclosed

    80.5%
  24. 24
    Muse Spark 1.2

    Metaclosed

    80.1%
  25. 25
    Qwen3.8 27B

    Alibabaopen

    79.8%
  26. 2678.7%
  27. 27
    DeepSeek V4 Pro 0813

    DeepSeekclosed

    78.7%
  28. 28
    Gemini 3.5 Flash

    Googleclosed

    78.7%
  29. 29
    GPT-5.4

    OpenAIclosed

    78.3%
  30. 30
    Muse Spark 1.1

    Metaclosed

    77.9%
  31. 31
    GLM-5.2

    Zhipu AIopen

    77.9%
  32. 32
    Gemini 3.6 Flash

    Googleclosed

    77.5%
  33. 33
    Qwen3.7 Max

    Alibabaclosed

    74.5%
  34. 34
    Gemini 3 Pro

    Googleclosed

    73.9%
  35. 35
    K2 Horizon 375B A23B

    MBZUAI Institute of Foundation Modelsopen

    71.9%
  36. 36
    Claude Sonnet 4.6

    Anthropicclosed

    71.2%
  37. 37
    Gemini 3.1 Pro

    Googleclosed

    70.7%
  38. 38
    Kimi K2.7 Code

    Moonshotopen

    67.4%
  39. 39
    Kimi K2.6

    Moonshotclosed

    65.9%
  40. 40
    MiMo-V2.5-Pro

    Xiaomiopen

    65.2%
  41. 41
    MiniMax M3

    MiniMaxopen

    65.2%
  42. 42
    Hy3

    Tencentopen

    64.4%
  43. 43
    DeepSeek V4 Pro

    DeepSeekopen

    64.0%
  44. 44
    MiMo-V2.5

    Xiaomiopen

    63.7%
  45. 45
    DeepSeek V4 Flash

    DeepSeekopen

    61.8%
  46. 46
    GLM-5.1

    Zhipu AIopen

    61.8%
  47. 47
    Qwen3.6 Plus

    Alibabaclosed

    61.4%
  48. 48
    Qwen3.7 Plus

    Alibabaclosed

    61.0%
  49. 49
    Qwen3.6 27B

    Alibabaopen

    60.7%
  50. 50
    GPT-5.4 Nano

    OpenAIclosed

    60.7%
  51. 51
    GPT-5.4 Mini

    OpenAIclosed

    59.2%
  52. 52
    Solar Pro 4

    Upstageclosed

    57.3%
  53. 5356.4%
  54. 54
    MiniMax M2.7

    MiniMaxclosed

    55.4%
  55. 55
    Ling-3.0 Flash

    InclusionAIopen

    55.4%
  56. 56
    Inkling

    Thinking Machinesopen

    55.1%
  57. 57
    Inkling-Small

    Thinking Machinesopen

    55.1%
  58. 5853.6%
  59. 59
    Muse Glimmer

    Metaopen

    51.7%
  60. 6051.3%
  61. 6150.6%
  62. 62
    LongCat-2.0

    Meituanopen

    50.2%
  63. 63
    DeepSeek V3.2

    DeepSeekopen

    46.8%
  64. 64
    Kimi K2.5

    Moonshotopen

    45.7%
  65. 65
    GLM-4.7

    Zhipu AIopen

    45.3%
  66. 66
    Qwen3.6 35B A3B

    Alibabaopen

    44.9%
  67. 67
    Gemma 4 31B

    Googleopen

    43.4%
  68. 68
    Ring-2.6-1T

    InclusionAIopen

    43.1%
  69. 69
    Grok 4.3

    xAIclosed

    39.7%
  70. 70
    GPT-5

    OpenAIclosed

    35.2%
  71. 7131.1%
  72. 72
    Devstral 2

    Mistralopen

    30.3%
  73. 73
    Gemini 2.5 Pro

    Googleclosed

    28.5%
  74. 74
    Ling-3.0 Tiny

    InclusionAIopen

    27.7%
  75. 75
    Mercury 2

    Inception Labsclosed

    27.3%
  76. 7626.6%
  77. 77
    gpt-oss-120B

    OpenAIopen

    26.2%
  78. 7824.3%
  79. 79
    Ling-2.6 Flash

    InclusionAIclosed

    24.3%
  80. 80
    Mistral Small 4

    Mistralopen

    21.0%
  81. 8120.6%
  82. 82
    DeepSeek R1

    DeepSeekopen

    19.1%
  83. 8318.4%
  84. 84
    DeepSeek V3

    DeepSeekopen

    16.9%
  85. 85
    K2 Think V2

    MBZUAI / G42 / LLM360open

    15.0%
  86. 86
    Mistral Medium 3.1

    Mistralclosed

    13.9%
  87. 87
    gpt-oss-20B

    OpenAIopen

    13.9%
  88. 8813.9%
  89. 89
    Mistral Large 3

    Mistralopen

    12.0%
  90. 90
    Solar Pro 3

    Upstageopen

    12.0%
  91. 91
    GPT-4.1 Mini

    OpenAIclosed

    10.1%
  92. 92
    Claude Haiku 3.5

    Anthropicclosed

    10.1%
  93. 93
    Ministral 3 14B

    Mistralopen

    9.7%
  94. 947.9%
  95. 956.7%
  96. 96
    GPT-4o Mini

    OpenAIclosed

    5.6%
  97. 975.6%
  98. 98
    Qwen3 32B

    Alibabaopen

    5.2%
  99. 994.9%
  100. 100
    Gemma 3 27B

    Googleopen

    4.5%
  101. 101
    Ministral 3 8B

    Mistralopen

    4.1%
  102. 102
    GPT-5 Mini

    OpenAIclosed

    3.7%
  103. 103
    GPT-4.1 Nano

    OpenAIclosed

    3.7%
  104. 1043.7%
  105. 1053.4%
  106. 106
    Llama 3.1 8B

    Metaopen

    1.5%
  107. 107
    Phi-4-mini

    Microsoftopen

    0.4%
  108. 108
    Gemma 3 4B

    Googleopen

    0.4%
  109. 109
    Gemma 3 12B

    Googleopen

    0.0%
  110. 110
    Ministral 3 3B

    Mistralopen

    0.0%

Back to all benchmarks