Reasoning & knowledge
AA-Omniscience Accuracy
Share of AA-Omniscience's 6,000 factual-recall questions answered correctly, across 42 topics in six domains (business, humanities and social sciences, STEM, health, law, and software engineering). This is the accuracy metric only — keep it distinct from the AA-Omniscience Index, a separate -100 to 100 metric that penalises hallucination and rewards abstention, and from the hallucination rate.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Reasoning & knowledge
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 163 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Claude Fable 5.167.2%
Anthropicclosed
- 2Claude Fable 565.4%
Anthropicclosed
- 3GPT-6 Astra62.6%
OpenAIclosed
- 4Claude Opus 560.9%
Anthropicclosed
- 5GPT-5.6 Sol59.4%
OpenAIclosed
- 6GPT-5.558.0%
OpenAIclosed
- 7Gemini 3.7 Flash55.3%
Googleclosed
- 8Gemini 3.8 Flash54.6%
Googleclosed
- 9Gemini 3 Flash53.4%
Googleclosed
- 10Muse Spark 1.152.1%
Metaclosed
- 11Grok 4.551.6%
xAIclosed
- 12Gemini 3.5 Flash51.4%
Googleclosed
- 13GPT-5.450.8%
OpenAIclosed
- 14Gemini 3.6 Flash50.0%
Googleclosed
- 15DeepSeek V4 Pro 081349.1%
DeepSeekclosed
- 16Claude Opus 4.748.9%
Anthropicclosed
- 17Claude Opus 4.848.8%
Anthropicclosed
- 18Grok 4.648.2%
xAIclosed
- 19Kimi K347.6%
Moonshotopen
- 20Claude Opus 4.647.0%
Anthropicclosed
- 21GPT-5.6 Terra46.8%
OpenAIclosed
- 22Claude Opus 4.546.6%
Anthropicclosed
- 23DeepSeek V4.1 Flash46.4%
DeepSeekopen
- 24Muse Spark 1.245.4%
Metaclosed
- 25Muse Spark 1.343.6%
Metaclosed
- 26DeepSeek V4 Pro43.0%
DeepSeekopen
- 27GPT-5.6 Luna42.7%
OpenAIclosed
- 28Inkling41.6%
Thinking Machinesopen
- 29Claude Sonnet 4.640.9%
Anthropicclosed
- 30Grok 440.5%
xAIclosed
- 31DeepSeek V4 Flash 073140.4%
DeepSeekopen
- 32GPT-540.3%
OpenAIclosed
- 33Claude Sonnet 540.1%
Anthropicclosed
- 34Kimi K2.7 Code39.6%
Moonshotopen
- 35Gemini 2.5 Pro39.1%
Googleclosed
- 36o338.6%
OpenAIclosed
- 37GPT-5.4 Mini37.5%
OpenAIclosed
- 38DeepSeek V4 Flash36.8%
DeepSeekopen
- 39Gemini 3.1 Flash-Lite36.3%
Googleclosed
- 40Kimi K2.535.2%
Moonshotopen
- 41Grok 4.334.8%
xAIclosed
- 42o134.5%
OpenAIclosed
- 43GLM-5.333.9%
Zhipu AIopen
- 44Inkling-Small33.2%
Thinking Machinesopen
- 45DeepSeek V3.233.0%
DeepSeekopen
- 46Kimi K2.632.6%
Moonshotclosed
- 47Hy332.0%
Tencentopen
- 48Qwen3.8 Max31.7%
Alibabaopen
- 49Qwen3.7 Max31.1%
Alibabaclosed
- 50Qwen3.5 397B-A17B30.8%
Alibabaopen
- 51DeepSeek R1-052830.5%
DeepSeekopen
- 52DeepSeek R130.5%
DeepSeekopen
- 53LongCat-2.029.6%
Meituanopen
- 54Gemini 3.5 Flash-Lite29.5%
Googleclosed
- 55GLM-4.729.3%
Zhipu AIopen
- 56DeepSeek V3.129.0%
DeepSeekopen
- 57Grok 328.9%
xAIclosed
- 58Claude 3.7 Sonnet28.0%
Anthropicclosed
- 59Hunyuan 3 Preview27.9%
Tencentclosed
- 60GPT-4.127.8%
OpenAIclosed
- 61GLM-5.3 Flash27.5%
Zhipu AIopen
- 62Kimi K227.4%
Moonshotopen
- 63Muse Glimmer27.0%
Metaopen
- 64MiniMax M2.726.8%
MiniMaxclosed
- 65Qwen3.6 Plus26.4%
Alibabaclosed
- 66GLM-526.3%
Zhipu AIopen
- 67MiniMax M2.526.2%
MiniMaxopen
- 68Gemini 2.5 Flash26.0%
Googleclosed
- 69GPT-5.4 Nano25.7%
OpenAIclosed
- 70Ring-2.6-1T25.7%
InclusionAIopen
- 71DeepSeek V325.5%
DeepSeekopen
- 72GPT-5 Mini25.0%
OpenAIclosed
- 73Mistral Large 325.0%
Mistralopen
- 74Llama 4 Maverick24.9%
Metaopen
- 75o4-mini24.8%
OpenAIclosed
- 76Mistral Medium 3.524.7%
Mistralopen
- 77Qwen3.8 Flash Next24.5%
Alibabaopen
- 78Qwen3 Max24.4%
Alibabaclosed
- 79GLM-5.224.3%
Zhipu AIopen
- 80GLM-5.123.7%
Zhipu AIopen
- 81Step-3.5 Flash23.6%
StepFunclosed
- 82Gemini 2.0 Flash23.5%
Googleclosed
- 83Llama 3.1 405B23.2%
Metaopen
- 84Agnes-3.0-Flash Preview23.0%
Agnes AIopen
- 85Grok 4 Fast22.8%
xAIclosed
- 86Nemotron 3 Ultra22.6%
NVIDIAopen
- 87Qwen3.7 Plus22.5%
Alibabaclosed
- 88Trinity Large Thinking22.5%
Arcee AIopen
- 89MiMo-V2.5-Pro22.4%
Xiaomiopen
- 90Ling-2.6 1T21.9%
InclusionAIopen
- 91gpt-oss-120B21.8%
OpenAIopen
- 92Mistral Small 421.7%
Mistralopen
- 93Mercury 221.2%
Inception Labsclosed
- 94GPT-421.0%
OpenAIclosed
- 95Devstral 220.8%
Mistralopen
- 96Mistral Medium 3.120.8%
Mistralclosed
- 97GPT-4.1 Mini20.3%
OpenAIclosed
- 98Gemma 4 31B20.0%
Googleopen
- 99Mistral Large 219.9%
Mistralclosed
- 100MiMo-V2-Flash19.8%
Xiaomiopen
- 101Llama 3.1 70B19.7%
Metaopen
- 102Qwen3.6 27B19.6%
Alibabaopen
- 103INTELLECT-319.6%
Prime Intellectopen
- 104DeepSeek-R1-Distill-Llama-70B19.2%
DeepSeekopen
- 105GPT-5 Nano19.1%
OpenAIclosed
- 106Llama 3.3 70B19.0%
Metaopen
- 107Qwen3-Next 80B-A3B19.0%
Alibabaopen
- 108Solar Pro 418.9%
Upstageclosed
- 109Qwen3.6 35B A3B18.8%
Alibabaopen
- 110Qwen3 235B-A22B18.5%
Alibabaopen
- 111Solar Pro 318.5%
Upstageopen
- 112K2 Horizon 375B A23B18.2%
MBZUAI Institute of Foundation Modelsopen
- 113Ling-3.0 Flash18.2%
InclusionAIopen
- 114Seed-OSS-36B-Instruct18.2%
ByteDance Seedopen
- 115K2 Think V218.0%
MBZUAI / G42 / LLM360open
- 116Gemini 2.5 Flash-Lite17.9%
Googleclosed
- 117Llama-3.1-Nemotron-70B Instruct17.8%
NVIDIAopen
- 118Llama 3 70B17.7%
Metaopen
- 119Claude 3 Haiku17.6%
Anthropicclosed
- 120Qwen2.5 72B17.5%
Alibabaopen
- 121Qwen3 32B17.4%
Alibabaopen
- 122MiMo-V2.516.8%
Xiaomiopen
- 123MiniMax M316.7%
MiniMaxopen
- 124Command A16.4%
Cohereclosed
- 125Qwen3-Coder 30B-A3B16.4%
Alibabaopen
- 126GLM-4.7 Flash16.2%
Zhipu AIclosed
- 127gpt-oss-20B16.0%
OpenAIopen
- 128Qwen3 Coder 480B15.7%
Alibabaopen
- 129Qwen3.8 27B15.6%
Alibabaopen
- 130Ling-2.6 Flash15.6%
InclusionAIclosed
- 131Llama 4 Scout15.2%
Metaopen
- 132OLMo 3 32B Think14.9%
Ai2open
- 133Mistral Small 3.214.8%
Mistralopen
- 134Devstral Small14.7%
Mistralopen
- 135Nemotron 3.5 Lightning14.4%
NVIDIAopen
- 136Qwen3-Omni-30B-A3B-Instruct14.3%
Alibabaopen
- 137Phi-414.1%
Microsoftopen
- 138GPT-4.1 Nano13.7%
OpenAIclosed
- 139Reka Flash 313.7%
Rekaopen
- 140Ministral 3 14B13.6%
Mistralopen
- 141Ministral 3 8B13.0%
Mistralopen
- 142Gemma 3 27B13.0%
Googleopen
- 143Granite 4.1 8B12.3%
IBMopen
- 144Olmo 3.1 32B Instruct12.0%
Ai2open
- 145Apertus 70B Instruct11.6%
Swiss AI Initiativeopen
- 146Granite 4.2 8B11.2%
IBMopen
- 147Llama 3.2 11B Vision10.6%
Metaopen
- 148Llama 3 8B10.4%
Metaopen
- 149Gemma 3 12B10.3%
Googleopen
- 150Granite 4.2 30B10.1%
IBMopen
- 151Apertus 8B Instruct9.7%
Swiss AI Initiativeopen
- 152Phi-4-mini9.5%
Microsoftopen
- 153Granite 4.0 Micro9.3%
IBMopen
- 154LFM2.5-8B-A1B9.3%
Liquid AIopen
- 155Granite 4.2 3B9.2%
IBMopen
- 156Ministral 3 3B9.0%
Mistralopen
- 157Mistral 7B9.0%
Mistralopen
- 158Llama 3.1 8B8.5%
Metaopen
- 159Ling-3.0 Tiny8.5%
InclusionAIopen
- 160Gemma 3 4B7.7%
Googleopen
- 161Olmo 3 7B Instruct7.4%
Ai2open
- 162Llama 3.2 1B7.0%
Metaopen
- 163LFM2.5-1.2B-Instruct7.0%
Liquid AIopen