Coding
LiveCodeBench
Contamination-resistant coding problems collected after model training cutoffs; score depends on the LiveCodeBench release and pass@k protocol.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 94 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
- Source
- livecodebench.github.io/
Scores
- 1Qwen3.8 27B90.3%
Alibabaopen
- 2Nemotron 3 Ultra89.0%
NVIDIAopen
- 3Claude Mythos 588.1%
Anthropicclosed
- 4DeepSeek V3.286.2%
DeepSeekopen
- 5Kimi K2.585.0%
Moonshotopen
- 6DeepSeek R1-052884.4%
DeepSeekopen
- 7Grok 481.9%
xAIclosed
- 8o380.8%
OpenAIclosed
- 9Qwen3 235B-A22B80.4%
Alibabaopen
- 10Gemini 2.5 Pro80.1%
Googleclosed
- 11Gemma 4 31B80.0%
Googleopen
- 12Gemma 4 26B77.1%
Googleopen
- 13Qwen3 Max76.7%
Alibabaclosed
- 14Granite 4.2 30B75.8%
IBMopen
- 15Gemini 2.5 Flash75.1%
Googleclosed
- 16DeepSeek V3.174.8%
DeepSeekopen
- 17Granite 4.2 8B73.2%
IBMopen
- 18o3-mini71.7%
OpenAIclosed
- 19Nemotron Nano 9B v271.1%
NVIDIAopen
- 20Nemotron Nano 3 30B68.3%
NVIDIAopen
- 21o167.9%
OpenAIclosed
- 22OLMo 3 32B Think67.2%
Ai2open
- 23Qwen3 32B65.7%
Alibabaopen
- 24QwQ-32B63.4%
Alibabaopen
- 25Claude Opus 462.4%
Anthropicclosed
- 26Claude Sonnet 459.4%
Anthropicclosed
- 27Qwen3 Coder 480B58.5%
Alibabaopen
- 28o1 Mini57.6%
OpenAIclosed
- 29DeepSeek-R1-Distill-Llama-70B57.5%
DeepSeekopen
- 30DeepSeek-R1-Distill-Qwen-32B57.2%
DeepSeekopen
- 31Qwen3-Next 80B-A3B56.6%
Alibabaopen
- 32Magistral Small55.8%
Mistralopen
- 33Qwen2.5 72B55.5%
Alibabaopen
- 34Phi-4 Reasoning53.8%
Microsoftopen
- 35Kimi K253.7%
Moonshotopen
- 36DeepSeek-R1 Distill Qwen 14B53.1%
DeepSeekopen
- 37Qwen2.5 32B Instruct51.2%
Alibabaopen
- 38DeepSeek V349.6%
DeepSeekopen
- 39Claude 3.5 Sonnet48.7%
Anthropicclosed
- 40Claude 3.5 Sonnet (Oct)48.7%
Anthropicclosed
- 41GPT-4.1 Mini48.3%
OpenAIclosed
- 42Mistral Large 346.5%
Mistralopen
- 43GPT-4.145.7%
OpenAIclosed
- 44Devstral 244.8%
Mistralopen
- 45Reka Flash 343.5%
Rekaopen
- 46Llama 4 Maverick43.4%
Metaopen
- 47Qwen2.5 14B Instruct42.6%
Alibabaopen
- 48Grok 342.5%
xAIclosed
- 49Mistral Medium 3.140.6%
Mistralclosed
- 50Qwen3-Coder 30B-A3B40.3%
Alibabaopen
- 51DeepSeek-R1 Distill Llama 8B39.6%
DeepSeekopen
- 52GPT-4 Turbo37.3%
OpenAIclosed
- 53GPT-4o Mini35.5%
OpenAIclosed
- 54Ministral 3 14B35.1%
Mistralopen
- 55GPT-4o (May 2024)33.4%
OpenAIclosed
- 56Llama 3.3 70B33.3%
Metaopen
- 57Llama 4 Scout32.8%
Metaopen
- 58GPT-4.1 Nano32.6%
OpenAIclosed
- 59Claude Haiku 3.531.4%
Anthropicclosed
- 60Ministral 3 8B30.3%
Mistralopen
- 61Gemma 3 27B29.7%
Googleopen
- 62Sonar29.5%
Perplexityclosed
- 63Command A28.7%
Cohereclosed
- 64Qwen2.5 7B28.7%
Alibabaopen
- 65Claude 3 Opus27.9%
Anthropicclosed
- 66Llama 3.1 405B27.7%
Metaopen
- 67Mistral Small 3.227.5%
Mistralopen
- 68Sonar Pro27.5%
Perplexityclosed
- 69Pixtral Large26.1%
Mistralclosed
- 70Ministral 3 3B24.7%
Mistralopen
- 71Gemma 3 12B24.6%
Googleopen
- 72Llama 3.1 70B23.2%
Metaopen
- 73Phi-423.1%
Microsoftopen
- 74Claude 3 Haiku22.5%
Anthropicclosed
- 75Gemini 1.5 Flash-8B21.7%
Googleclosed
- 76Claude 2.119.5%
Anthropicclosed
- 77Granite 4.0 Micro18.0%
IBMopen
- 78Mistral Large17.8%
Mistralclosed
- 79Claude 3 Sonnet17.5%
Anthropicclosed
- 80Claude 217.1%
Anthropicclosed
- 81Llama-3.1-Nemotron-70B Instruct16.9%
NVIDIAopen
- 82DeepSeek Coder V2 Lite15.8%
DeepSeekopen
- 83Mixtral 8x22B14.8%
Mistralopen
- 84Jamba 1.5 Large14.3%
AI21open
- 85Mistral Small14.1%
Mistralclosed
- 86Phi-4-multimodal13.1%
Microsoftopen
- 87Phi-4-mini12.6%
Microsoftopen
- 88Gemma 3 4B12.6%
Googleopen
- 89Llama 3.1 8B11.6%
Metaopen
- 90Phi-3 Mini 3.8B11.6%
Microsoftopen
- 91Gemini 1.0 Pro11.6%
Googleclosed
- 92DBRX Instruct9.3%
Databricksopen
- 93OLMo 2 32B6.8%
Ai2open
- 94Mixtral 8x7B6.6%
Mistralopen