LLMcompare

Search

Search for a command to run...

Reasoning & knowledge

AA-Omniscience Accuracy

Share of AA-Omniscience's 6,000 factual-recall questions answered correctly, across 42 topics in six domains (business, humanities and social sciences, STEM, health, law, and software engineering). This is the accuracy metric only — keep it distinct from the AA-Omniscience Index, a separate -100 to 100 metric that penalises hallucination and rewards abstention, and from the hallucination rate.

How models are tested

Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.

Category
Reasoning & knowledge
Metric
Percent
Direction
Higher is better
Coverage
163 / 318Models in this catalog with a published score
Updated
Catalog snapshot date

Scores

  1. 1
    Claude Fable 5.1

    Anthropicclosed

    67.2%
  2. 2
    Claude Fable 5

    Anthropicclosed

    65.4%
  3. 3
    GPT-6 Astra

    OpenAIclosed

    62.6%
  4. 4
    Claude Opus 5

    Anthropicclosed

    60.9%
  5. 5
    GPT-5.6 Sol

    OpenAIclosed

    59.4%
  6. 6
    GPT-5.5

    OpenAIclosed

    58.0%
  7. 7
    Gemini 3.7 Flash

    Googleclosed

    55.3%
  8. 8
    Gemini 3.8 Flash

    Googleclosed

    54.6%
  9. 9
    Gemini 3 Flash

    Googleclosed

    53.4%
  10. 10
    Muse Spark 1.1

    Metaclosed

    52.1%
  11. 11
    Grok 4.5

    xAIclosed

    51.6%
  12. 12
    Gemini 3.5 Flash

    Googleclosed

    51.4%
  13. 13
    GPT-5.4

    OpenAIclosed

    50.8%
  14. 14
    Gemini 3.6 Flash

    Googleclosed

    50.0%
  15. 15
    DeepSeek V4 Pro 0813

    DeepSeekclosed

    49.1%
  16. 16
    Claude Opus 4.7

    Anthropicclosed

    48.9%
  17. 17
    Claude Opus 4.8

    Anthropicclosed

    48.8%
  18. 18
    Grok 4.6

    xAIclosed

    48.2%
  19. 19
    Kimi K3

    Moonshotopen

    47.6%
  20. 20
    Claude Opus 4.6

    Anthropicclosed

    47.0%
  21. 21
    GPT-5.6 Terra

    OpenAIclosed

    46.8%
  22. 22
    Claude Opus 4.5

    Anthropicclosed

    46.6%
  23. 2346.4%
  24. 24
    Muse Spark 1.2

    Metaclosed

    45.4%
  25. 25
    Muse Spark 1.3

    Metaclosed

    43.6%
  26. 26
    DeepSeek V4 Pro

    DeepSeekopen

    43.0%
  27. 27
    GPT-5.6 Luna

    OpenAIclosed

    42.7%
  28. 28
    Inkling

    Thinking Machinesopen

    41.6%
  29. 29
    Claude Sonnet 4.6

    Anthropicclosed

    40.9%
  30. 30
    Grok 4

    xAIclosed

    40.5%
  31. 3140.4%
  32. 32
    GPT-5

    OpenAIclosed

    40.3%
  33. 33
    Claude Sonnet 5

    Anthropicclosed

    40.1%
  34. 34
    Kimi K2.7 Code

    Moonshotopen

    39.6%
  35. 35
    Gemini 2.5 Pro

    Googleclosed

    39.1%
  36. 36
    o3

    OpenAIclosed

    38.6%
  37. 37
    GPT-5.4 Mini

    OpenAIclosed

    37.5%
  38. 38
    DeepSeek V4 Flash

    DeepSeekopen

    36.8%
  39. 3936.3%
  40. 40
    Kimi K2.5

    Moonshotopen

    35.2%
  41. 41
    Grok 4.3

    xAIclosed

    34.8%
  42. 42
    o1

    OpenAIclosed

    34.5%
  43. 43
    GLM-5.3

    Zhipu AIopen

    33.9%
  44. 44
    Inkling-Small

    Thinking Machinesopen

    33.2%
  45. 45
    DeepSeek V3.2

    DeepSeekopen

    33.0%
  46. 46
    Kimi K2.6

    Moonshotclosed

    32.6%
  47. 47
    Hy3

    Tencentopen

    32.0%
  48. 48
    Qwen3.8 Max

    Alibabaopen

    31.7%
  49. 49
    Qwen3.7 Max

    Alibabaclosed

    31.1%
  50. 5030.8%
  51. 51
    DeepSeek R1-0528

    DeepSeekopen

    30.5%
  52. 52
    DeepSeek R1

    DeepSeekopen

    30.5%
  53. 53
    LongCat-2.0

    Meituanopen

    29.6%
  54. 5429.5%
  55. 55
    GLM-4.7

    Zhipu AIopen

    29.3%
  56. 56
    DeepSeek V3.1

    DeepSeekopen

    29.0%
  57. 57
    Grok 3

    xAIclosed

    28.9%
  58. 58
    Claude 3.7 Sonnet

    Anthropicclosed

    28.0%
  59. 59
    Hunyuan 3 Preview

    Tencentclosed

    27.9%
  60. 60
    GPT-4.1

    OpenAIclosed

    27.8%
  61. 61
    GLM-5.3 Flash

    Zhipu AIopen

    27.5%
  62. 62
    Kimi K2

    Moonshotopen

    27.4%
  63. 63
    Muse Glimmer

    Metaopen

    27.0%
  64. 64
    MiniMax M2.7

    MiniMaxclosed

    26.8%
  65. 65
    Qwen3.6 Plus

    Alibabaclosed

    26.4%
  66. 66
    GLM-5

    Zhipu AIopen

    26.3%
  67. 67
    MiniMax M2.5

    MiniMaxopen

    26.2%
  68. 68
    Gemini 2.5 Flash

    Googleclosed

    26.0%
  69. 69
    GPT-5.4 Nano

    OpenAIclosed

    25.7%
  70. 70
    Ring-2.6-1T

    InclusionAIopen

    25.7%
  71. 71
    DeepSeek V3

    DeepSeekopen

    25.5%
  72. 72
    GPT-5 Mini

    OpenAIclosed

    25.0%
  73. 73
    Mistral Large 3

    Mistralopen

    25.0%
  74. 7424.9%
  75. 75
    o4-mini

    OpenAIclosed

    24.8%
  76. 7624.7%
  77. 7724.5%
  78. 78
    Qwen3 Max

    Alibabaclosed

    24.4%
  79. 79
    GLM-5.2

    Zhipu AIopen

    24.3%
  80. 80
    GLM-5.1

    Zhipu AIopen

    23.7%
  81. 81
    Step-3.5 Flash

    StepFunclosed

    23.6%
  82. 82
    Gemini 2.0 Flash

    Googleclosed

    23.5%
  83. 8323.2%
  84. 8423.0%
  85. 85
    Grok 4 Fast

    xAIclosed

    22.8%
  86. 8622.6%
  87. 87
    Qwen3.7 Plus

    Alibabaclosed

    22.5%
  88. 8822.5%
  89. 89
    MiMo-V2.5-Pro

    Xiaomiopen

    22.4%
  90. 90
    Ling-2.6 1T

    InclusionAIopen

    21.9%
  91. 91
    gpt-oss-120B

    OpenAIopen

    21.8%
  92. 92
    Mistral Small 4

    Mistralopen

    21.7%
  93. 93
    Mercury 2

    Inception Labsclosed

    21.2%
  94. 94
    GPT-4

    OpenAIclosed

    21.0%
  95. 95
    Devstral 2

    Mistralopen

    20.8%
  96. 96
    Mistral Medium 3.1

    Mistralclosed

    20.8%
  97. 97
    GPT-4.1 Mini

    OpenAIclosed

    20.3%
  98. 98
    Gemma 4 31B

    Googleopen

    20.0%
  99. 99
    Mistral Large 2

    Mistralclosed

    19.9%
  100. 100
    MiMo-V2-Flash

    Xiaomiopen

    19.8%
  101. 10119.7%
  102. 102
    Qwen3.6 27B

    Alibabaopen

    19.6%
  103. 103
    INTELLECT-3

    Prime Intellectopen

    19.6%
  104. 10419.2%
  105. 105
    GPT-5 Nano

    OpenAIclosed

    19.1%
  106. 10619.0%
  107. 10719.0%
  108. 108
    Solar Pro 4

    Upstageclosed

    18.9%
  109. 109
    Qwen3.6 35B A3B

    Alibabaopen

    18.8%
  110. 110
    Qwen3 235B-A22B

    Alibabaopen

    18.5%
  111. 111
    Solar Pro 3

    Upstageopen

    18.5%
  112. 112
    K2 Horizon 375B A23B

    MBZUAI Institute of Foundation Modelsopen

    18.2%
  113. 113
    Ling-3.0 Flash

    InclusionAIopen

    18.2%
  114. 114
    Seed-OSS-36B-Instruct

    ByteDance Seedopen

    18.2%
  115. 115
    K2 Think V2

    MBZUAI / G42 / LLM360open

    18.0%
  116. 11617.9%
  117. 11717.8%
  118. 118
    Llama 3 70B

    Metaopen

    17.7%
  119. 119
    Claude 3 Haiku

    Anthropicclosed

    17.6%
  120. 120
    Qwen2.5 72B

    Alibabaopen

    17.5%
  121. 121
    Qwen3 32B

    Alibabaopen

    17.4%
  122. 122
    MiMo-V2.5

    Xiaomiopen

    16.8%
  123. 123
    MiniMax M3

    MiniMaxopen

    16.7%
  124. 124
    Command A

    Cohereclosed

    16.4%
  125. 12516.4%
  126. 126
    GLM-4.7 Flash

    Zhipu AIclosed

    16.2%
  127. 127
    gpt-oss-20B

    OpenAIopen

    16.0%
  128. 128
    Qwen3 Coder 480B

    Alibabaopen

    15.7%
  129. 129
    Qwen3.8 27B

    Alibabaopen

    15.6%
  130. 130
    Ling-2.6 Flash

    InclusionAIclosed

    15.6%
  131. 13115.2%
  132. 13214.9%
  133. 13314.8%
  134. 134
    Devstral Small

    Mistralopen

    14.7%
  135. 13514.4%
  136. 13614.3%
  137. 137
    Phi-4

    Microsoftopen

    14.1%
  138. 138
    GPT-4.1 Nano

    OpenAIclosed

    13.7%
  139. 139
    Reka Flash 3

    Rekaopen

    13.7%
  140. 140
    Ministral 3 14B

    Mistralopen

    13.6%
  141. 141
    Ministral 3 8B

    Mistralopen

    13.0%
  142. 142
    Gemma 3 27B

    Googleopen

    13.0%
  143. 14312.3%
  144. 14412.0%
  145. 145
    Apertus 70B Instruct

    Swiss AI Initiativeopen

    11.6%
  146. 14611.2%
  147. 14710.6%
  148. 148
    Llama 3 8B

    Metaopen

    10.4%
  149. 149
    Gemma 3 12B

    Googleopen

    10.3%
  150. 15010.1%
  151. 151
    Apertus 8B Instruct

    Swiss AI Initiativeopen

    9.7%
  152. 152
    Phi-4-mini

    Microsoftopen

    9.5%
  153. 1539.3%
  154. 154
    LFM2.5-8B-A1B

    Liquid AIopen

    9.3%
  155. 1559.2%
  156. 156
    Ministral 3 3B

    Mistralopen

    9.0%
  157. 157
    Mistral 7B

    Mistralopen

    9.0%
  158. 158
    Llama 3.1 8B

    Metaopen

    8.5%
  159. 159
    Ling-3.0 Tiny

    InclusionAIopen

    8.5%
  160. 160
    Gemma 3 4B

    Googleopen

    7.7%
  161. 1617.4%
  162. 162
    Llama 3.2 1B

    Metaopen

    7.0%
  163. 1637.0%

Back to all benchmarks