Reasoning & knowledge
IFBench
Ai2's precise instruction-following benchmark: 58 verifiable out-of-domain output constraints held out from the training constraints, so it measures generalisation to unseen instructions rather than familiarity with common ones. Scored as constraint-satisfaction accuracy.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Reasoning & knowledge
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 137 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1MiniMax M382.9%
MiniMaxopen
- 2Nemotron 3 Ultra81.4%
NVIDIAopen
- 3Grok 4.381.3%
xAIclosed
- 4Qwen3.7 Max80.5%
Alibabaclosed
- 5MiMo-V2.5-Pro79.9%
Xiaomiopen
- 6DeepSeek V4 Flash79.2%
DeepSeekopen
- 7Qwen3.5 397B-A17B78.8%
Alibabaopen
- 8Gemini 3 Flash78.0%
Googleclosed
- 9Qwen3.7 Plus78.0%
Alibabaclosed
- 10Gemini 3.1 Flash-Lite77.2%
Googleclosed
- 11DeepSeek V4 Pro76.5%
DeepSeekopen
- 12GLM-5.176.3%
Zhipu AIopen
- 13Gemini 3.5 Flash76.3%
Googleclosed
- 14Kimi K2.676.0%
Moonshotclosed
- 15GPT-5.575.9%
OpenAIclosed
- 16GPT-5.4 Nano75.9%
OpenAIclosed
- 17MiniMax M2.775.7%
MiniMaxclosed
- 18Gemma 4 31B75.6%
Googleopen
- 19GPT-5 Mini75.4%
OpenAIclosed
- 20Qwen3.6 Plus75.2%
Alibabaclosed
- 21Agnes-3.0-Flash Preview74.2%
Agnes AIopen
- 22GPT-5.473.9%
OpenAIclosed
- 23GLM-5.273.3%
Zhipu AIopen
- 24GPT-5.4 Mini73.3%
OpenAIclosed
- 25GPT-573.1%
OpenAIclosed
- 26GPT-5.6 Sol72.7%
OpenAIclosed
- 27GLM-572.3%
Zhipu AIopen
- 28MiMo-V2-Flash71.8%
Xiaomiopen
- 29MiniMax M2.571.6%
MiniMaxopen
- 30o371.4%
OpenAIclosed
- 31GPT-5.6 Terra71.2%
OpenAIclosed
- 32Solar Pro 371.2%
Upstageopen
- 33o170.3%
OpenAIclosed
- 34Kimi K2.570.2%
Moonshotopen
- 35Mercury 269.8%
Inception Labsclosed
- 36gpt-oss-120B69.0%
OpenAIopen
- 37Mistral Medium 3.568.8%
Mistralopen
- 38o4-mini68.7%
OpenAIclosed
- 39GLM-4.767.9%
Zhipu AIopen
- 40GPT-5 Nano67.6%
OpenAIclosed
- 41Qwen3.6 27B67.6%
Alibabaopen
- 42MiMo-V2.567.1%
Xiaomiopen
- 43gpt-oss-20B65.1%
OpenAIopen
- 44Step-3.5 Flash64.6%
StepFunclosed
- 45Qwen3.6 35B A3B64.4%
Alibabaopen
- 46Claude Fable 563.5%
Anthropicclosed
- 47Kimi K2.7 Code63.1%
Moonshotopen
- 48Hunyuan 3 Preview63.1%
Tencentclosed
- 49K2 Think V262.8%
MBZUAI / G42 / LLM360open
- 50Claude Opus 4.862.2%
Anthropicclosed
- 51GLM-4.7 Flash60.8%
Zhipu AIclosed
- 52DeepSeek V3.260.7%
DeepSeekopen
- 53Qwen3-Next 80B-A3B60.7%
Alibabaopen
- 54Claude Opus 4.758.6%
Anthropicclosed
- 55Claude Opus 4.558.0%
Anthropicclosed
- 56Ling-2.6 Flash57.4%
InclusionAIclosed
- 57Ling-2.6 1T56.9%
InclusionAIopen
- 58Claude Sonnet 4.656.6%
Anthropicclosed
- 59Trinity Large Thinking56.3%
Arcee AIopen
- 60LFM2.5-8B-A1B55.6%
Liquid AIopen
- 61Grok 453.7%
xAIclosed
- 62Claude Opus 4.653.1%
Anthropicclosed
- 63Grok 4 Fast50.5%
xAIclosed
- 64Gemini 2.5 Flash50.3%
Googleclosed
- 65Gemini 2.5 Flash-Lite49.9%
Googleclosed
- 66OLMo 3 32B Think49.1%
Ai2open
- 67Gemini 2.5 Pro48.7%
Googleclosed
- 68Claude 3.7 Sonnet48.3%
Anthropicclosed
- 69Mistral Small 448.2%
Mistralopen
- 70Llama 3.3 70B47.1%
Metaopen
- 71Grok 346.9%
xAIclosed
- 72Ring-2.6-1T44.6%
InclusionAIopen
- 73Qwen3 Max44.1%
Alibabaclosed
- 74LFM2.5-1.2B-Instruct43.8%
Liquid AIopen
- 75GPT-4.143.0%
OpenAIclosed
- 76Llama 4 Maverick43.0%
Metaopen
- 77Seed-OSS-36B-Instruct41.9%
ByteDance Seedopen
- 78DeepSeek V3.141.5%
DeepSeekopen
- 79Kimi K241.5%
Moonshotopen
- 80Qwen3 Coder 480B40.5%
Alibabaopen
- 81Gemini 2.0 Flash40.2%
Googleclosed
- 82Mistral Medium 3.139.8%
Mistralclosed
- 83DeepSeek R1-052839.6%
DeepSeekopen
- 84Llama 4 Scout39.5%
Metaopen
- 85Olmo 3.1 32B Instruct39.2%
Ai2open
- 86DeepSeek R139.0%
DeepSeekopen
- 87Llama 3.1 405B39.0%
Metaopen
- 88QwQ-32B38.8%
Alibabaopen
- 89Qwen3 235B-A22B38.7%
Alibabaopen
- 90Granite 4.1 8B38.6%
IBMopen
- 91GPT-4.1 Mini38.3%
OpenAIclosed
- 92Devstral 238.1%
Mistralopen
- 93OLMo 2 32B38.1%
Ai2open
- 94Llama 3 70B37.1%
Metaopen
- 95Qwen2.5 72B36.9%
Alibabaopen
- 96Gemma 3 12B36.7%
Googleopen
- 97Command A36.5%
Cohereclosed
- 98Qwen3 32B36.3%
Alibabaopen
- 99Mistral Large 336.2%
Mistralopen
- 100Claude 3 Haiku36.1%
Anthropicclosed
- 101DeepSeek V334.8%
DeepSeekopen
- 102Devstral Small34.6%
Mistralopen
- 103Pixtral Large34.5%
Mistralclosed
- 104Llama 3.1 70B34.4%
Metaopen
- 105INTELLECT-334.0%
Prime Intellectopen
- 106Mistral Small 3.233.5%
Mistralopen
- 107GPT-433.2%
OpenAIclosed
- 108Olmo 3 7B Instruct32.8%
Ai2open
- 109Qwen3-Coder 30B-A3B32.7%
Alibabaopen
- 110GPT-4.1 Nano32.0%
OpenAIclosed
- 111Ministral 3 14B32.0%
Mistralopen
- 112Gemma 3 27B31.8%
Googleopen
- 113Mistral Large 231.2%
Mistralclosed
- 114Qwen3-Omni-30B-A3B-Instruct31.2%
Alibabaopen
- 115GPT-4o Mini31.0%
OpenAIclosed
- 116Llama-3.1-Nemotron-70B Instruct30.7%
NVIDIAopen
- 117Llama 3.2 11B Vision30.4%
Metaopen
- 118Reka Flash 330.4%
Rekaopen
- 119Ministral 3 8B29.1%
Mistralopen
- 120Llama 3.1 8B28.6%
Metaopen
- 121Gemma 3 4B28.3%
Googleopen
- 122Kimi Linear 48B A3B Instruct28.1%
Moonshotopen
- 123DeepSeek-R1-Distill-Llama-70B27.6%
DeepSeekopen
- 124Ministral 3 3B26.8%
Mistralopen
- 125Llama 3.2 3B26.2%
Metaopen
- 126Apertus 70B Instruct25.9%
Swiss AI Initiativeopen
- 127Granite 4.0 Micro24.8%
IBMopen
- 128Llama 3 8B24.6%
Metaopen
- 129Phi-3 Mini 3.8B23.9%
Microsoftopen
- 130Phi-423.5%
Microsoftopen
- 131DeepSeek-R1-Distill-Qwen-32B22.9%
DeepSeekopen
- 132Llama 3.2 1B22.8%
Metaopen
- 133Apertus 8B Instruct22.4%
Swiss AI Initiativeopen
- 134DeepSeek-R1 Distill Qwen 14B22.1%
DeepSeekopen
- 135Phi-4-mini21.1%
Microsoftopen
- 136Mistral 7B19.9%
Mistralopen
- 137DeepSeek-R1 Distill Llama 8B17.6%
DeepSeekopen