Coding
BigCodeBench
Realistic function-level coding benchmark with 1,140 tasks across 7 languages; pass@1 depends on the release and prompting.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Coding
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 45 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
- Source
- bigcode-bench.github.io/
Scores
- 1GPT-4o (May 2024)51.1%
OpenAIclosed
- 2DeepSeek V350.0%
DeepSeekopen
- 3Llama 4 Maverick49.7%
Metaopen
- 4Qwen2.5-Coder 32B49.0%
Alibabaopen
- 5GPT-4.1 Mini48.9%
OpenAIclosed
- 6GPT-4 Turbo48.2%
OpenAIclosed
- 7DeepSeek Coder V248.2%
DeepSeekopen
- 8Llama 3.3 70B46.9%
Metaopen
- 9Claude 3.5 Sonnet46.8%
Anthropicclosed
- 10GPT-4o Mini46.1%
OpenAIclosed
- 11Claude Haiku 3.546.1%
Anthropicclosed
- 12Llama 3.1 70B46.1%
Metaopen
- 13Qwen2.5 72B45.8%
Alibabaopen
- 14Phi-445.5%
Microsoftopen
- 15Claude 3 Opus45.5%
Anthropicclosed
- 16Qwen2.5 32B Instruct45.0%
Alibabaopen
- 17Claude 3.5 Sonnet (Oct)44.6%
Anthropicclosed
- 18DeepSeek-R1-Distill-Qwen-32B43.9%
DeepSeekopen
- 19Llama 3 70B43.6%
Metaopen
- 20Gemma 2 27B42.8%
Googleopen
- 21Claude 3 Sonnet42.7%
Anthropicclosed
- 22Codestral 22B41.8%
Mistralopen
- 23Code Llama 70B Instruct40.7%
Metaopen
- 24Mixtral 8x22B40.6%
Mistralopen
- 25Qwen2.5 14B Instruct39.8%
Alibabaopen
- 26Claude 3 Haiku39.4%
Anthropicclosed
- 27Llama-3.1-Nemotron-70B Instruct38.7%
NVIDIAopen
- 28DeepSeek-R1 Distill Qwen 14B38.1%
DeepSeekopen
- 29Yi-Large37.7%
01.AIclosed
- 30Phi-3 Medium 14B37.6%
Microsoftopen
- 31Qwen2.5 7B37.6%
Alibabaopen
- 32DeepSeek Coder V2 Lite36.8%
DeepSeekopen
- 33DeepSeek-R1-Distill-Llama-70B35.3%
DeepSeekopen
- 34Gemma 2 9B34.7%
Googleopen
- 35Yi-1.5 34B Chat33.9%
01.AIopen
- 36Command R (08-2024)33.8%
Cohereclosed
- 37Llama 3.1 8B32.8%
Metaopen
- 38Llama 3 8B31.9%
Metaopen
- 39Mistral Large30.0%
Mistralclosed
- 40Phi-3 Mini 3.8B29.6%
Microsoftopen
- 41Code Llama 34B Instruct29.0%
Metaopen
- 42Llama 3.2 3B23.4%
Metaopen
- 43Mistral 7B19.5%
Mistralopen
- 44DeepSeek-R1 Distill Llama 8B10.6%
DeepSeekopen
- 45Llama 3.2 1B8.2%
Metaopen