Coding
Terminal-Bench 2.1
Terminal-Bench 2.1 contains 89 agentic terminal tasks. Scores are agent-system results and vary with harness, effort level, timeout, resource allocation, task revision, and evaluation date; they are not model-only measurements.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 110 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Claude Fable 5.191.4%
Anthropicclosed
- 2Claude Opus 589.1%
Anthropicclosed
- 3GPT-6 Astra88.4%
OpenAIclosed
- 4Grok 4.688.4%
xAIclosed
- 5GPT-5.6 Sol88.0%
OpenAIclosed
- 6GPT-5.6 Terra88.0%
OpenAIclosed
- 7Gemini 3.8 Flash87.6%
Googleclosed
- 8Qwen3.8 Flash Next86.1%
Alibabaopen
- 9Gemini 3.7 Flash85.8%
Googleclosed
- 10Muse Spark 1.385.8%
Metaclosed
- 11Hy4 Preview85.4%
Tencentopen
- 12Kimi K385.0%
Moonshotopen
- 13Claude Fable 584.6%
Anthropicclosed
- 14Claude Opus 4.884.6%
Anthropicclosed
- 15GPT-5.584.3%
OpenAIclosed
- 16GLM-5.3 Flash84.3%
Zhipu AIopen
- 17GLM-5.383.9%
Zhipu AIopen
- 18Claude Mythos 583.8%
Anthropicclosed
- 19Claude Opus 4.783.1%
Anthropicclosed
- 20Grok 4.581.6%
xAIclosed
- 21Qwen3.8 Max81.3%
Alibabaopen
- 22GPT-5.6 Luna80.9%
OpenAIclosed
- 23Claude Sonnet 580.5%
Anthropicclosed
- 24Muse Spark 1.280.1%
Metaclosed
- 25Qwen3.8 27B79.8%
Alibabaopen
- 26DeepSeek V4 Flash 073178.7%
DeepSeekopen
- 27DeepSeek V4 Pro 081378.7%
DeepSeekclosed
- 28Gemini 3.5 Flash78.7%
Googleclosed
- 29GPT-5.478.3%
OpenAIclosed
- 30Muse Spark 1.177.9%
Metaclosed
- 31GLM-5.277.9%
Zhipu AIopen
- 32Gemini 3.6 Flash77.5%
Googleclosed
- 33Qwen3.7 Max74.5%
Alibabaclosed
- 34Gemini 3 Pro73.9%
Googleclosed
- 35K2 Horizon 375B A23B71.9%
MBZUAI Institute of Foundation Modelsopen
- 36Claude Sonnet 4.671.2%
Anthropicclosed
- 37Gemini 3.1 Pro70.7%
Googleclosed
- 38Kimi K2.7 Code67.4%
Moonshotopen
- 39Kimi K2.665.9%
Moonshotclosed
- 40MiMo-V2.5-Pro65.2%
Xiaomiopen
- 41MiniMax M365.2%
MiniMaxopen
- 42Hy364.4%
Tencentopen
- 43DeepSeek V4 Pro64.0%
DeepSeekopen
- 44MiMo-V2.563.7%
Xiaomiopen
- 45DeepSeek V4 Flash61.8%
DeepSeekopen
- 46GLM-5.161.8%
Zhipu AIopen
- 47Qwen3.6 Plus61.4%
Alibabaclosed
- 48Qwen3.7 Plus61.0%
Alibabaclosed
- 49Qwen3.6 27B60.7%
Alibabaopen
- 50GPT-5.4 Nano60.7%
OpenAIclosed
- 51GPT-5.4 Mini59.2%
OpenAIclosed
- 52Solar Pro 457.3%
Upstageclosed
- 53Nemotron 3 Ultra56.4%
NVIDIAopen
- 54MiniMax M2.755.4%
MiniMaxclosed
- 55Ling-3.0 Flash55.4%
InclusionAIopen
- 56Inkling55.1%
Thinking Machinesopen
- 57Inkling-Small55.1%
Thinking Machinesopen
- 58Gemini 3.5 Flash-Lite53.6%
Googleclosed
- 59Muse Glimmer51.7%
Metaopen
- 60Qwen3.5 397B-A17B51.3%
Alibabaopen
- 61Mistral Medium 3.550.6%
Mistralopen
- 62LongCat-2.050.2%
Meituanopen
- 63DeepSeek V3.246.8%
DeepSeekopen
- 64Kimi K2.545.7%
Moonshotopen
- 65GLM-4.745.3%
Zhipu AIopen
- 66Qwen3.6 35B A3B44.9%
Alibabaopen
- 67Gemma 4 31B43.4%
Googleopen
- 68Ring-2.6-1T43.1%
InclusionAIopen
- 69Grok 4.339.7%
xAIclosed
- 70GPT-535.2%
OpenAIclosed
- 71Gemini 3.1 Flash-Lite31.1%
Googleclosed
- 72Devstral 230.3%
Mistralopen
- 73Gemini 2.5 Pro28.5%
Googleclosed
- 74Ling-3.0 Tiny27.7%
InclusionAIopen
- 75Mercury 227.3%
Inception Labsclosed
- 76Granite 4.2 30B26.6%
IBMopen
- 77gpt-oss-120B26.2%
OpenAIopen
- 78Nemotron 3.5 Lightning24.3%
NVIDIAopen
- 79Ling-2.6 Flash24.3%
InclusionAIclosed
- 80Mistral Small 421.0%
Mistralopen
- 81Trinity Large Thinking20.6%
Arcee AIopen
- 82DeepSeek R119.1%
DeepSeekopen
- 83Granite 4.2 8B18.4%
IBMopen
- 84DeepSeek V316.9%
DeepSeekopen
- 85K2 Think V215.0%
MBZUAI / G42 / LLM360open
- 86Mistral Medium 3.113.9%
Mistralclosed
- 87gpt-oss-20B13.9%
OpenAIopen
- 88Granite 4.2 3B13.9%
IBMopen
- 89Mistral Large 312.0%
Mistralopen
- 90Solar Pro 312.0%
Upstageopen
- 91GPT-4.1 Mini10.1%
OpenAIclosed
- 92Claude Haiku 3.510.1%
Anthropicclosed
- 93Ministral 3 14B9.7%
Mistralopen
- 94Llama 4 Maverick7.9%
Metaopen
- 95Qwen3-Next 80B-A3B6.7%
Alibabaopen
- 96GPT-4o Mini5.6%
OpenAIclosed
- 97Mistral Small 3.25.6%
Mistralopen
- 98Qwen3 32B5.2%
Alibabaopen
- 99Llama 3.3 70B4.9%
Metaopen
- 100Gemma 3 27B4.5%
Googleopen
- 101Ministral 3 8B4.1%
Mistralopen
- 102GPT-5 Mini3.7%
OpenAIclosed
- 103GPT-4.1 Nano3.7%
OpenAIclosed
- 104Llama 4 Scout3.7%
Metaopen
- 105Granite 4.1 8B3.4%
IBMopen
- 106Llama 3.1 8B1.5%
Metaopen
- 107Phi-4-mini0.4%
Microsoftopen
- 108Gemma 3 4B0.4%
Googleopen
- 109Gemma 3 12B0.0%
Googleopen
- 110Ministral 3 3B0.0%
Mistralopen