LLMcompare

Search

Search for a command to run...

Composite ranking

Reasoning & knowledge

A single derived ranking across the 8 reasoning & knowledgebenchmarks in this catalog. This is not a published benchmark score — it's computed here.

Methodology

Each eligible benchmark's scores are z-score normalized against models released in the past 12 months (since 2025-09-29), then combined as a shrunken mean: sum(z) / (n + 2), with 2 dummy average results so thin coverage still cannot dominate. Saturated benches and benches scored on fewer than ten peer models are excluded. A model needs a published score on at least 3 of the 8 benchmarks below to receive a composite; every contributing score is shown so nothing is hidden behind the composite number.

Benchmarks included
MMLU-Pro, GPQA, HLE, AIME, CritPt, AA-LCR, Omniscience Acc., IFBench
Min. coverage
3 of 8 benchmarks
Coverage
200 modelsModels in this catalog with enough published scores for a composite
Updated
Catalog snapshot date

Composite ranking

  1. 1
    Claude Fable 5.1

    Anthropicclosed5/8 benchmarks

    +1.14
    • GPQA: 93.7%
    • HLE: 59.0%
    • CritPt: 29.7%
    • AA-LCR: 83.0%
    • Omniscience Acc.: 67.2%
  2. 2
    GPT-6 Astra

    OpenAIclosed5/8 benchmarks

    +1.09
    • GPQA: 96.1%
    • HLE: 55.0%
    • CritPt: 31.7%
    • AA-LCR: 81.0%
    • Omniscience Acc.: 62.6%
  3. 3
    Claude Opus 5

    Anthropicclosed5/8 benchmarks

    +1.00
    • GPQA: 93.2%
    • HLE: 54.9%
    • CritPt: 29.1%
    • AA-LCR: 79.3%
    • Omniscience Acc.: 60.9%
  4. 4
    GPT-5.6 Sol

    OpenAIclosed6/8 benchmarks

    +0.98
    • GPQA: 94.1%
    • HLE: 49.5%
    • CritPt: 32.3%
    • AA-LCR: 84.0%
    • Omniscience Acc.: 59.4%
    • IFBench: 72.7%
  5. 5
    Claude Fable 5

    Anthropicclosed6/8 benchmarks

    +0.93
    • GPQA: 92.6%
    • HLE: 55.5%
    • CritPt: 28.6%
    • AA-LCR: 82.3%
    • Omniscience Acc.: 65.4%
    • IFBench: 63.5%
  6. 6
    GPT-5.5

    OpenAIclosed6/8 benchmarks

    +0.89
    • GPQA: 93.5%
    • HLE: 45.8%
    • CritPt: 27.1%
    • AA-LCR: 84.3%
    • Omniscience Acc.: 58.0%
    • IFBench: 75.9%
  7. 7
    Kimi K3

    Moonshotopen5/8 benchmarks

    +0.78
    • GPQA: 93.5%
    • HLE: 46.9%
    • CritPt: 23.4%
    • AA-LCR: 88.7%
    • Omniscience Acc.: 47.6%
  8. 8
    GPT-5.6 Terra

    OpenAIclosed6/8 benchmarks

    +0.76
    • GPQA: 92.5%
    • HLE: 42.9%
    • CritPt: 30.0%
    • AA-LCR: 83.0%
    • Omniscience Acc.: 46.8%
    • IFBench: 71.2%
  9. 9
    Muse Spark 1.3

    Metaclosed5/8 benchmarks

    +0.74
    • GPQA: 93.5%
    • HLE: 48.7%
    • CritPt: 24.9%
    • AA-LCR: 83.0%
    • Omniscience Acc.: 43.6%
  10. 10
    Gemini 3.8 Flash

    Googleclosed5/8 benchmarks

    +0.74
    • GPQA: 95.3%
    • HLE: 47.8%
    • CritPt: 18.3%
    • AA-LCR: 81.3%
    • Omniscience Acc.: 54.6%
  11. 11
    GPT-5.4

    OpenAIclosed6/8 benchmarks

    +0.72
    • GPQA: 92.0%
    • HLE: 43.7%
    • CritPt: 23.4%
    • AA-LCR: 82.0%
    • Omniscience Acc.: 50.8%
    • IFBench: 73.9%
  12. 12
    Gemini 3.7 Flash

    Googleclosed5/8 benchmarks

    +0.69
    • GPQA: 94.5%
    • HLE: 47.9%
    • CritPt: 14.3%
    • AA-LCR: 81.7%
    • Omniscience Acc.: 55.3%
  13. 13
    Grok 4.6

    xAIclosed5/8 benchmarks

    +0.61
    • GPQA: 94.9%
    • HLE: 42.9%
    • CritPt: 17.1%
    • AA-LCR: 80.3%
    • Omniscience Acc.: 48.2%
  14. 14
    Claude Opus 4.8

    Anthropicclosed6/8 benchmarks

    +0.59
    • GPQA: 92.0%
    • HLE: 48.7%
    • CritPt: 20.9%
    • AA-LCR: 77.7%
    • Omniscience Acc.: 48.8%
    • IFBench: 62.2%
  15. 15
    DeepSeek V4 Pro 0813

    DeepSeekclosed5/8 benchmarks

    +0.59
    • GPQA: 92.8%
    • HLE: 41.0%
    • CritPt: 18.0%
    • AA-LCR: 80.3%
    • Omniscience Acc.: 49.1%
  16. 16
    Grok 4.5

    xAIclosed5/8 benchmarks

    +0.59
    • GPQA: 93.1%
    • HLE: 42.7%
    • CritPt: 15.4%
    • AA-LCR: 79.3%
    • Omniscience Acc.: 51.6%
  17. 17
    Muse Spark 1.1

    Metaclosed5/8 benchmarks

    +0.58
    • GPQA: 89.8%
    • HLE: 46.2%
    • CritPt: 15.1%
    • AA-LCR: 77.7%
    • Omniscience Acc.: 52.1%
  18. 18
    GPT-5.6 Luna

    OpenAIclosed5/8 benchmarks

    +0.57
    • GPQA: 91.1%
    • HLE: 39.5%
    • CritPt: 20.6%
    • AA-LCR: 83.7%
    • Omniscience Acc.: 42.7%
  19. 19
    Muse Spark 1.2

    Metaclosed5/8 benchmarks

    +0.56
    • GPQA: 90.4%
    • HLE: 45.5%
    • CritPt: 17.7%
    • AA-LCR: 79.0%
    • Omniscience Acc.: 45.4%
  20. 20
    Gemini 3.5 Flash

    Googleclosed6/8 benchmarks

    +0.54
    • GPQA: 92.2%
    • HLE: 42.7%
    • CritPt: 13.1%
    • AA-LCR: 73.3%
    • Omniscience Acc.: 51.4%
    • IFBench: 76.3%
  21. 21
    Claude Sonnet 5

    Anthropicclosed5/8 benchmarks

    +0.49
    • GPQA: 91.1%
    • HLE: 41.3%
    • CritPt: 16.9%
    • AA-LCR: 82.0%
    • Omniscience Acc.: 40.1%
  22. 22
    Gemini 3.6 Flash

    Googleclosed5/8 benchmarks

    +0.48
    • GPQA: 92.8%
    • HLE: 40.8%
    • CritPt: 10.6%
    • AA-LCR: 80.0%
    • Omniscience Acc.: 50.0%
  23. 23
    DeepSeek V4.1 Flash

    DeepSeekopen4/8 benchmarks

    +0.48
    • HLE: 39.2%
    • CritPt: 14.3%
    • AA-LCR: 84.0%
    • Omniscience Acc.: 46.4%
  24. 24
    Gemini 3 Flash

    Googleclosed6/8 benchmarks

    +0.47
    • GPQA: 89.8%
    • HLE: 36.6%
    • CritPt: 8.6%
    • AA-LCR: 78.0%
    • Omniscience Acc.: 53.4%
    • IFBench: 78.0%
  25. 25
    GLM-5.3

    Zhipu AIopen5/8 benchmarks

    +0.46
    • GPQA: 91.7%
    • HLE: 42.3%
    • CritPt: 19.1%
    • AA-LCR: 79.7%
    • Omniscience Acc.: 33.9%
  26. 26
    Qwen3.8 Max

    Alibabaopen5/8 benchmarks

    +0.44
    • GPQA: 92.8%
    • HLE: 43.1%
    • CritPt: 17.7%
    • AA-LCR: 80.3%
    • Omniscience Acc.: 31.7%
  27. 27
    DeepSeek V4 Flash 0731

    DeepSeekopen5/8 benchmarks

    +0.44
    • GPQA: 90.8%
    • HLE: 38.6%
    • CritPt: 16.6%
    • AA-LCR: 79.7%
    • Omniscience Acc.: 40.4%
  28. 28
    Qwen3.7 Max

    Alibabaclosed6/8 benchmarks

    +0.43
    • GPQA: 92.3%
    • HLE: 40.5%
    • CritPt: 13.4%
    • AA-LCR: 79.0%
    • Omniscience Acc.: 31.1%
    • IFBench: 80.5%
  29. 29
    Grok 4.7

    xAIclosed3/8 benchmarks

    +0.43
    • HLE: 43.0%
    • CritPt: 18.0%
    • AA-LCR: 77.0%
  30. 30
    Claude Mythos 5

    Anthropicclosed3/8 benchmarks

    +0.42
    • GPQA: 92.6%
    • HLE: 32.5%
    • AIME: 97.0%
  31. 31
    DeepSeek V4 Pro

    DeepSeekopen6/8 benchmarks

    +0.41
    • GPQA: 88.8%
    • HLE: 37.5%
    • CritPt: 12.9%
    • AA-LCR: 74.7%
    • Omniscience Acc.: 43.0%
    • IFBench: 76.5%
  32. 32
    GLM-5.2

    Zhipu AIopen6/8 benchmarks

    +0.40
    • GPQA: 89.5%
    • HLE: 41.1%
    • CritPt: 20.9%
    • AA-LCR: 78.3%
    • Omniscience Acc.: 24.3%
    • IFBench: 73.3%
  33. 33
    Claude Opus 4.7

    Anthropicclosed6/8 benchmarks

    +0.40
    • GPQA: 91.4%
    • HLE: 42.3%
    • CritPt: 12.0%
    • AA-LCR: 78.7%
    • Omniscience Acc.: 48.9%
    • IFBench: 58.6%
  34. 34
    GLM-5.3 Flash

    Zhipu AIopen5/8 benchmarks

    +0.32
    • GPQA: 91.2%
    • HLE: 39.9%
    • CritPt: 15.4%
    • AA-LCR: 80.0%
    • Omniscience Acc.: 27.5%
  35. 35
    Kimi K2.6

    Moonshotclosed6/8 benchmarks

    +0.32
    • GPQA: 91.1%
    • HLE: 37.5%
    • CritPt: 8.0%
    • AA-LCR: 81.0%
    • Omniscience Acc.: 32.6%
    • IFBench: 76.0%
  36. 36
    Kimi K2.5

    Moonshotopen8/8 benchmarks

    +0.31
    • MMLU-Pro: 87.1%
    • GPQA: 87.9%
    • HLE: 30.7%
    • AIME: 96.1%
    • CritPt: 3.1%
    • AA-LCR: 78.0%
    • Omniscience Acc.: 35.2%
    • IFBench: 70.2%
  37. 37
    Grok 4.3

    xAIclosed6/8 benchmarks

    +0.31
    • GPQA: 90.1%
    • HLE: 37.2%
    • CritPt: 8.0%
    • AA-LCR: 73.0%
    • Omniscience Acc.: 34.8%
    • IFBench: 81.3%
  38. 38
    Claude Opus 4.6

    Anthropicclosed6/8 benchmarks

    +0.31
    • GPQA: 89.6%
    • HLE: 39.9%
    • CritPt: 12.6%
    • AA-LCR: 78.0%
    • Omniscience Acc.: 47.0%
    • IFBench: 53.1%
  39. 39
    GPT-5

    OpenAIclosed7/8 benchmarks

    +0.28
    • GPQA: 85.4%
    • HLE: 28.5%
    • AIME: 94.6%
    • CritPt: 5.7%
    • AA-LCR: 78.2%
    • Omniscience Acc.: 40.3%
    • IFBench: 73.1%
  40. 40
    DeepSeek V4 Flash

    DeepSeekopen6/8 benchmarks

    +0.28
    • GPQA: 89.4%
    • HLE: 34.8%
    • CritPt: 7.1%
    • AA-LCR: 74.3%
    • Omniscience Acc.: 36.8%
    • IFBench: 79.2%
  41. 41
    Kimi K2.7 Code

    Moonshotopen6/8 benchmarks

    +0.26
    • GPQA: 89.6%
    • HLE: 35.0%
    • CritPt: 10.0%
    • AA-LCR: 79.3%
    • Omniscience Acc.: 39.6%
    • IFBench: 63.1%
  42. 42
    GPT-5.4 Mini

    OpenAIclosed6/8 benchmarks

    +0.23
    • GPQA: 87.5%
    • HLE: 28.1%
    • CritPt: 10.0%
    • AA-LCR: 77.0%
    • Omniscience Acc.: 37.5%
    • IFBench: 73.3%
  43. 43
    MiniMax M3

    MiniMaxopen6/8 benchmarks

    +0.22
    • GPQA: 92.9%
    • HLE: 39.0%
    • CritPt: 3.7%
    • AA-LCR: 83.0%
    • Omniscience Acc.: 16.7%
    • IFBench: 82.9%
  44. 44
    Qwen3.8 Flash Next

    Alibabaopen5/8 benchmarks

    +0.22
    • GPQA: 92.3%
    • HLE: 38.0%
    • CritPt: 11.1%
    • AA-LCR: 79.7%
    • Omniscience Acc.: 24.5%
  45. 45
    o1 Preview

    OpenAIclosed3/8 benchmarks

    +0.22
    • MMLU-Pro: 84.8%
    • GPQA: 76.5%
    • AIME: 79.3%
  46. 46
    Nemotron 3 Ultra

    NVIDIAopen7/8 benchmarks

    +0.19
    • MMLU-Pro: 86.8%
    • GPQA: 86.7%
    • HLE: 28.4%
    • CritPt: 3.1%
    • AA-LCR: 79.3%
    • Omniscience Acc.: 22.6%
    • IFBench: 81.4%
  47. 47
    Qwen3.7 Plus

    Alibabaclosed6/8 benchmarks

    +0.19
    • GPQA: 90.0%
    • HLE: 35.6%
    • CritPt: 9.1%
    • AA-LCR: 73.0%
    • Omniscience Acc.: 22.5%
    • IFBench: 78.0%
  48. 48
    Inkling

    Thinking Machinesopen5/8 benchmarks

    +0.17
    • GPQA: 87.2%
    • HLE: 31.9%
    • CritPt: 5.4%
    • AA-LCR: 77.3%
    • Omniscience Acc.: 41.6%
  49. 49
    o3

    OpenAIclosed8/8 benchmarks

    +0.16
    • MMLU-Pro: 85.3%
    • GPQA: 82.7%
    • HLE: 20.1%
    • AIME: 88.9%
    • CritPt: 1.1%
    • AA-LCR: 74.7%
    • Omniscience Acc.: 38.6%
    • IFBench: 71.4%
  50. 50
    Inkling-Small

    Thinking Machinesopen5/8 benchmarks

    +0.16
    • GPQA: 89.5%
    • HLE: 33.3%
    • CritPt: 8.3%
    • AA-LCR: 75.7%
    • Omniscience Acc.: 33.2%
  51. 51
    MiMo-V2.5-Pro

    Xiaomiopen6/8 benchmarks

    +0.15
    • GPQA: 86.6%
    • HLE: 35.7%
    • CritPt: 4.0%
    • AA-LCR: 79.7%
    • Omniscience Acc.: 22.4%
    • IFBench: 79.9%
  52. 52
    GPT-5 Mini

    OpenAIclosed6/8 benchmarks

    +0.15
    • GPQA: 82.8%
    • HLE: 21.5%
    • AIME: 91.1%
    • AA-LCR: 72.3%
    • Omniscience Acc.: 25.0%
    • IFBench: 75.4%
  53. 53
    Grok 4

    xAIclosed8/8 benchmarks

    +0.14
    • MMLU-Pro: 86.6%
    • GPQA: 87.7%
    • HLE: 26.7%
    • AIME: 92.7%
    • CritPt: 2.0%
    • AA-LCR: 68.0%
    • Omniscience Acc.: 40.5%
    • IFBench: 53.7%
  54. 54
    Qwen3.5 397B-A17B

    Alibabaopen6/8 benchmarks

    +0.13
    • GPQA: 89.3%
    • HLE: 29.0%
    • CritPt: 1.7%
    • AA-LCR: 77.3%
    • Omniscience Acc.: 30.8%
    • IFBench: 78.8%
  55. 55
    DeepSeek V3.2

    DeepSeekopen8/8 benchmarks

    +0.13
    • MMLU-Pro: 86.2%
    • GPQA: 84.0%
    • HLE: 24.6%
    • AIME: 92.0%
    • CritPt: 2.9%
    • AA-LCR: 73.3%
    • Omniscience Acc.: 33.0%
    • IFBench: 60.7%
  56. 56
    Claude Opus 4.5

    Anthropicclosed6/8 benchmarks

    +0.12
    • GPQA: 86.6%
    • HLE: 30.1%
    • CritPt: 4.6%
    • AA-LCR: 77.3%
    • Omniscience Acc.: 46.6%
    • IFBench: 58.0%
  57. 57
    Hy3

    Tencentopen5/8 benchmarks

    +0.12
    • GPQA: 89.7%
    • HLE: 33.5%
    • CritPt: 4.9%
    • AA-LCR: 79.0%
    • Omniscience Acc.: 32.0%
  58. 58
    Claude Sonnet 4.6

    Anthropicclosed6/8 benchmarks

    +0.10
    • GPQA: 87.5%
    • HLE: 33.6%
    • CritPt: 3.1%
    • AA-LCR: 80.0%
    • Omniscience Acc.: 40.9%
    • IFBench: 56.6%
  59. 59
    GPT-5.4 Nano

    OpenAIclosed6/8 benchmarks

    +0.09
    • GPQA: 81.7%
    • HLE: 28.3%
    • CritPt: 9.3%
    • AA-LCR: 76.7%
    • Omniscience Acc.: 25.7%
    • IFBench: 75.9%
  60. 60
    Agnes-3.0-Flash Preview

    Agnes AIopen4/8 benchmarks

    +0.07
    • GPQA: 85.0%
    • AA-LCR: 68.3%
    • Omniscience Acc.: 23.0%
    • IFBench: 74.2%
  61. 61
    Qwen3.6 Plus

    Alibabaclosed6/8 benchmarks

    +0.07
    • GPQA: 88.2%
    • HLE: 27.8%
    • CritPt: 2.9%
    • AA-LCR: 78.3%
    • Omniscience Acc.: 26.4%
    • IFBench: 75.2%
  62. 62
    GLM-5.1

    Zhipu AIopen6/8 benchmarks

    +0.06
    • GPQA: 86.8%
    • HLE: 30.1%
    • CritPt: 4.6%
    • AA-LCR: 73.7%
    • Omniscience Acc.: 23.7%
    • IFBench: 76.3%
  63. 63
    MiniMax M2.7

    MiniMaxclosed6/8 benchmarks

    +0.06
    • GPQA: 87.4%
    • HLE: 29.6%
    • CritPt: 0.6%
    • AA-LCR: 78.3%
    • Omniscience Acc.: 26.8%
    • IFBench: 75.7%
  64. 64
    Gemini 2.5 Pro

    Googleclosed8/8 benchmarks

    +0.04
    • MMLU-Pro: 86.2%
    • GPQA: 84.4%
    • HLE: 22.5%
    • AIME: 87.7%
    • CritPt: 2.6%
    • AA-LCR: 69.0%
    • Omniscience Acc.: 39.1%
    • IFBench: 48.7%
  65. 65
    Qwen3.8 27B

    Alibabaopen5/8 benchmarks

    +0.01
    • GPQA: 90.5%
    • HLE: 33.9%
    • CritPt: 5.4%
    • AA-LCR: 82.0%
    • Omniscience Acc.: 15.6%
  66. 66
    Gemma 4 31B

    Googleopen7/8 benchmarks

    -0.00
    • MMLU-Pro: 85.2%
    • GPQA: 85.7%
    • HLE: 23.6%
    • CritPt: 1.4%
    • AA-LCR: 69.7%
    • Omniscience Acc.: 20.0%
    • IFBench: 75.6%
  67. 67
    Nemotron Nano 3 30B

    NVIDIAopen3/8 benchmarks

    -0.01
    • MMLU-Pro: 78.3%
    • HLE: 10.6%
    • AIME: 89.1%
  68. 68
    Gemini 3.1 Flash-Lite

    Googleclosed6/8 benchmarks

    -0.02
    • GPQA: 82.2%
    • HLE: 17.2%
    • CritPt: 1.1%
    • AA-LCR: 74.3%
    • Omniscience Acc.: 36.3%
    • IFBench: 77.2%
  69. 69
    GLM-5

    Zhipu AIopen6/8 benchmarks

    -0.02
    • GPQA: 82.0%
    • HLE: 29.3%
    • CritPt: 2.0%
    • AA-LCR: 75.7%
    • Omniscience Acc.: 26.3%
    • IFBench: 72.3%
  70. 70
    Gemini 3.5 Flash-Lite

    Googleclosed4/8 benchmarks

    -0.04
    • GPQA: 83.8%
    • HLE: 18.8%
    • AA-LCR: 76.0%
    • Omniscience Acc.: 29.5%
  71. 71
    K2 Horizon 375B A23B

    MBZUAI Institute of Foundation Modelsopen5/8 benchmarks

    -0.04
    • GPQA: 87.3%
    • HLE: 32.0%
    • CritPt: 4.6%
    • AA-LCR: 80.0%
    • Omniscience Acc.: 18.2%
  72. 72
    GLM-4.7

    Zhipu AIopen6/8 benchmarks

    -0.05
    • GPQA: 85.9%
    • HLE: 27.4%
    • CritPt: 1.7%
    • AA-LCR: 71.0%
    • Omniscience Acc.: 29.3%
    • IFBench: 67.9%
  73. 73
    Solar Pro 4

    Upstageclosed5/8 benchmarks

    -0.08
    • GPQA: 89.1%
    • HLE: 29.2%
    • CritPt: 5.4%
    • AA-LCR: 74.0%
    • Omniscience Acc.: 18.9%
  74. 74
    Hunyuan 3 Preview

    Tencentclosed6/8 benchmarks

    -0.09
    • GPQA: 86.7%
    • HLE: 27.8%
    • CritPt: 4.6%
    • AA-LCR: 64.7%
    • Omniscience Acc.: 27.9%
    • IFBench: 63.1%
  75. 75
    Muse Glimmer

    Metaopen5/8 benchmarks

    -0.09
    • GPQA: 83.5%
    • HLE: 22.0%
    • CritPt: 2.6%
    • AA-LCR: 83.3%
    • Omniscience Acc.: 27.0%
  76. 76
    MiniMax M2.5

    MiniMaxopen6/8 benchmarks

    -0.10
    • GPQA: 84.8%
    • HLE: 20.5%
    • CritPt: 1.1%
    • AA-LCR: 73.3%
    • Omniscience Acc.: 26.2%
    • IFBench: 71.6%
  77. 77
    Gemma 4 26B

    Googleopen3/8 benchmarks

    -0.13
    • MMLU-Pro: 82.6%
    • GPQA: 82.3%
    • HLE: 8.7%
  78. 78
    MiMo-V2.5

    Xiaomiopen6/8 benchmarks

    -0.13
    • GPQA: 84.9%
    • HLE: 27.2%
    • CritPt: 3.7%
    • AA-LCR: 73.0%
    • Omniscience Acc.: 16.8%
    • IFBench: 67.1%
  79. 79
    MiMo-V2-Flash

    Xiaomiopen6/8 benchmarks

    -0.14
    • GPQA: 83.5%
    • HLE: 22.1%
    • CritPt: 2.9%
    • AA-LCR: 71.3%
    • Omniscience Acc.: 19.8%
    • IFBench: 71.8%
  80. 80
    Qwen3.6 27B

    Alibabaopen6/8 benchmarks

    -0.15
    • GPQA: 84.2%
    • HLE: 23.1%
    • CritPt: 1.1%
    • AA-LCR: 77.3%
    • Omniscience Acc.: 19.6%
    • IFBench: 67.6%
  81. 81
    LongCat-2.0

    Meituanopen5/8 benchmarks

    -0.15
    • GPQA: 78.0%
    • HLE: 33.7%
    • CritPt: 2.6%
    • AA-LCR: 65.0%
    • Omniscience Acc.: 29.6%
  82. 82
    o4-mini

    OpenAIclosed7/8 benchmarks

    -0.17
    • GPQA: 78.4%
    • HLE: 16.5%
    • AIME: 92.7%
    • CritPt: 0.6%
    • AA-LCR: 61.0%
    • Omniscience Acc.: 24.8%
    • IFBench: 68.7%
  83. 83
    o1

    OpenAIclosed7/8 benchmarks

    -0.19
    • MMLU-Pro: 84.1%
    • GPQA: 74.7%
    • HLE: 7.0%
    • CritPt: 0.3%
    • AA-LCR: 65.0%
    • Omniscience Acc.: 34.5%
    • IFBench: 70.3%
  84. 84
    Phi-4 Reasoning

    Microsoftopen3/8 benchmarks

    -0.20
    • MMLU-Pro: 74.3%
    • GPQA: 65.8%
    • AIME: 62.9%
  85. 85
    Mistral Medium 3.5

    Mistralopen5/8 benchmarks

    -0.20
    • GPQA: 74.8%
    • HLE: 13.8%
    • AA-LCR: 69.3%
    • Omniscience Acc.: 24.7%
    • IFBench: 68.8%
  86. 86
    Qwen3-Next 80B-A3B

    Alibabaopen7/8 benchmarks

    -0.20
    • MMLU-Pro: 80.6%
    • GPQA: 75.9%
    • HLE: 12.6%
    • AIME: 69.5%
    • AA-LCR: 63.7%
    • Omniscience Acc.: 19.0%
    • IFBench: 60.7%
  87. 87
    gpt-oss-120B

    OpenAIopen7/8 benchmarks

    -0.21
    • GPQA: 78.2%
    • HLE: 19.6%
    • AIME: 92.5%
    • CritPt: 1.1%
    • AA-LCR: 52.0%
    • Omniscience Acc.: 21.8%
    • IFBench: 69.0%
  88. 88
    DeepSeek R1-0528

    DeepSeekopen8/8 benchmarks

    -0.23
    • MMLU-Pro: 85.0%
    • GPQA: 81.3%
    • HLE: 15.8%
    • AIME: 87.5%
    • CritPt: 1.4%
    • AA-LCR: 55.7%
    • Omniscience Acc.: 30.5%
    • IFBench: 39.6%
  89. 89
    Ling-3.0 Flash

    InclusionAIopen5/8 benchmarks

    -0.23
    • GPQA: 85.5%
    • HLE: 23.7%
    • CritPt: 1.7%
    • AA-LCR: 73.0%
    • Omniscience Acc.: 18.2%
  90. 90
    Qwen3.6 35B A3B

    Alibabaopen6/8 benchmarks

    -0.23
    • GPQA: 84.1%
    • HLE: 22.2%
    • CritPt: 0.3%
    • AA-LCR: 71.7%
    • Omniscience Acc.: 18.8%
    • IFBench: 64.4%
  91. 91
    DeepSeek V3.1

    DeepSeekopen8/8 benchmarks

    -0.25
    • MMLU-Pro: 84.8%
    • GPQA: 77.9%
    • HLE: 14.3%
    • AIME: 88.4%
    • CritPt: 2.0%
    • AA-LCR: 56.7%
    • Omniscience Acc.: 29.0%
    • IFBench: 41.5%
  92. 92
    Grok 4 Fast

    xAIclosed6/8 benchmarks

    -0.28
    • GPQA: 84.7%
    • HLE: 19.1%
    • CritPt: 2.9%
    • AA-LCR: 73.7%
    • Omniscience Acc.: 22.8%
    • IFBench: 50.5%
  93. 93
    Ring-2.6-1T

    InclusionAIopen6/8 benchmarks

    -0.29
    • GPQA: 85.7%
    • HLE: 21.6%
    • CritPt: 3.7%
    • AA-LCR: 70.0%
    • Omniscience Acc.: 25.7%
    • IFBench: 44.6%
  94. 94
    Qwen3 Max

    Alibabaclosed7/8 benchmarks

    -0.29
    • MMLU-Pro: 84.1%
    • GPQA: 76.4%
    • HLE: 11.9%
    • AIME: 80.7%
    • AA-LCR: 50.0%
    • Omniscience Acc.: 24.4%
    • IFBench: 44.1%
  95. 95
    o3-mini

    OpenAIclosed3/8 benchmarks

    -0.30
    • MMLU-Pro: 79.1%
    • GPQA: 74.8%
    • HLE: 7.9%
  96. 96
    Step-3.5 Flash

    StepFunclosed6/8 benchmarks

    -0.33
    • GPQA: 83.1%
    • HLE: 21.1%
    • CritPt: 2.5%
    • AA-LCR: 50.0%
    • Omniscience Acc.: 23.6%
    • IFBench: 64.6%
  97. 97
    GPT-5 Nano

    OpenAIclosed6/8 benchmarks

    -0.39
    • GPQA: 67.6%
    • HLE: 9.5%
    • AIME: 85.2%
    • AA-LCR: 45.0%
    • Omniscience Acc.: 19.1%
    • IFBench: 67.6%
  98. 98
    DeepSeek R1

    DeepSeekopen8/8 benchmarks

    -0.41
    • MMLU-Pro: 84.0%
    • GPQA: 70.8%
    • HLE: 8.5%
    • AIME: 70.0%
    • CritPt: 0.6%
    • AA-LCR: 57.7%
    • Omniscience Acc.: 30.5%
    • IFBench: 39.0%
  99. 99
    Grok 3

    xAIclosed7/8 benchmarks

    -0.42
    • MMLU-Pro: 79.9%
    • GPQA: 69.3%
    • HLE: 4.1%
    • AIME: 58.0%
    • AA-LCR: 58.0%
    • Omniscience Acc.: 28.9%
    • IFBench: 46.9%
  100. 100
    Kimi K2

    Moonshotopen7/8 benchmarks

    -0.44
    • MMLU-Pro: 81.1%
    • GPQA: 76.6%
    • HLE: 7.4%
    • AIME: 49.5%
    • AA-LCR: 53.0%
    • Omniscience Acc.: 27.4%
    • IFBench: 41.5%
  101. 101
    Gemini 2.5 Flash

    Googleclosed6/8 benchmarks

    -0.44
    • GPQA: 79.0%
    • HLE: 12.1%
    • CritPt: 1.1%
    • AA-LCR: 65.3%
    • Omniscience Acc.: 26.0%
    • IFBench: 50.3%
  102. 102
    GPT-4.1

    OpenAIclosed7/8 benchmarks

    -0.44
    • MMLU-Pro: 80.6%
    • GPQA: 66.6%
    • HLE: 4.2%
    • AIME: 46.4%
    • AA-LCR: 68.3%
    • Omniscience Acc.: 27.8%
    • IFBench: 43.0%
  103. 103
    Mercury 2

    Inception Labsclosed6/8 benchmarks

    -0.45
    • GPQA: 77.0%
    • HLE: 17.1%
    • CritPt: 0.8%
    • AA-LCR: 43.7%
    • Omniscience Acc.: 21.2%
    • IFBench: 69.8%
  104. 104
    K2 Think V2

    MBZUAI / G42 / LLM360open5/8 benchmarks

    -0.48
    • GPQA: 71.3%
    • HLE: 10.1%
    • AA-LCR: 57.0%
    • Omniscience Acc.: 18.0%
    • IFBench: 62.8%
  105. 105
    Qwen3 235B-A22B

    Alibabaopen5/8 benchmarks

    -0.51
    • GPQA: 70.0%
    • HLE: 11.0%
    • AIME: 81.5%
    • Omniscience Acc.: 18.5%
    • IFBench: 38.7%
  106. 106
    gpt-oss-20B

    OpenAIopen7/8 benchmarks

    -0.52
    • GPQA: 68.8%
    • HLE: 11.0%
    • AIME: 91.7%
    • CritPt: 1.4%
    • AA-LCR: 34.7%
    • Omniscience Acc.: 16.0%
    • IFBench: 65.1%
  107. 107
    Granite 4.2 30B

    IBMopen7/8 benchmarks

    -0.52
    • MMLU-Pro: 77.6%
    • GPQA: 64.4%
    • HLE: 11.2%
    • AIME: 89.2%
    • CritPt: 0.3%
    • AA-LCR: 49.0%
    • Omniscience Acc.: 10.1%
  108. 108
    Claude 3.7 Sonnet

    Anthropicclosed5/8 benchmarks

    -0.52
    • GPQA: 77.2%
    • HLE: 9.7%
    • CritPt: 0.9%
    • Omniscience Acc.: 28.0%
    • IFBench: 48.3%
  109. 109
    OLMo 3 32B Think

    Ai2open6/8 benchmarks

    -0.53
    • MMLU-Pro: 75.9%
    • GPQA: 61.0%
    • HLE: 6.4%
    • AIME: 73.7%
    • Omniscience Acc.: 14.9%
    • IFBench: 49.1%
  110. 110
    Nemotron 3.5 Lightning

    NVIDIAopen4/8 benchmarks

    -0.54
    • GPQA: 74.3%
    • HLE: 10.6%
    • AA-LCR: 60.3%
    • Omniscience Acc.: 14.4%
  111. 111
    Solar Pro 3

    Upstageopen5/8 benchmarks

    -0.57
    • GPQA: 72.4%
    • HLE: 10.3%
    • AA-LCR: 32.3%
    • Omniscience Acc.: 18.5%
    • IFBench: 71.2%
  112. 112
    Claude 3.5 Sonnet (Oct)

    Anthropicclosed3/8 benchmarks

    -0.58
    • MMLU-Pro: 77.2%
    • GPQA: 59.9%
    • HLE: 3.7%
  113. 113
    Sonar Pro

    Perplexityclosed3/8 benchmarks

    -0.60
    • MMLU-Pro: 75.5%
    • GPQA: 57.8%
    • HLE: 6.6%
  114. 114
    Granite 4.2 8B

    IBMopen7/8 benchmarks

    -0.60
    • MMLU-Pro: 74.0%
    • GPQA: 63.1%
    • HLE: 9.7%
    • AIME: 86.7%
    • CritPt: 0.3%
    • AA-LCR: 45.0%
    • Omniscience Acc.: 11.2%
  115. 115
    Trinity Large Thinking

    Arcee AIopen6/8 benchmarks

    -0.61
    • GPQA: 75.2%
    • HLE: 15.8%
    • CritPt: 0.9%
    • AA-LCR: 38.0%
    • Omniscience Acc.: 22.5%
    • IFBench: 56.3%
  116. 116
    Claude 3.5 Sonnet

    Anthropicclosed3/8 benchmarks

    -0.61
    • MMLU-Pro: 75.1%
    • GPQA: 59.9%
    • HLE: 3.7%
  117. 117
    Seed-OSS-36B-Instruct

    ByteDance Seedopen5/8 benchmarks

    -0.62
    • GPQA: 72.6%
    • HLE: 9.9%
    • AA-LCR: 61.3%
    • Omniscience Acc.: 18.2%
    • IFBench: 41.9%
  118. 118
    Ling-3.0 Tiny

    InclusionAIopen4/8 benchmarks

    -0.62
    • GPQA: 73.4%
    • HLE: 9.3%
    • AA-LCR: 60.3%
    • Omniscience Acc.: 8.5%
  119. 119
    o1 Mini

    OpenAIclosed3/8 benchmarks

    -0.62
    • MMLU-Pro: 74.2%
    • GPQA: 60.3%
    • HLE: 3.6%
  120. 120
    Mistral Small 4

    Mistralopen6/8 benchmarks

    -0.64
    • GPQA: 76.9%
    • HLE: 9.9%
    • CritPt: 0.3%
    • AA-LCR: 49.7%
    • Omniscience Acc.: 21.7%
    • IFBench: 48.2%
  121. 121
    Ling-2.6 1T

    InclusionAIopen6/8 benchmarks

    -0.65
    • GPQA: 75.2%
    • HLE: 8.7%
    • CritPt: 0.3%
    • AA-LCR: 41.7%
    • Omniscience Acc.: 21.9%
    • IFBench: 56.9%
  122. 122
    Llama 4 Maverick

    Metaopen7/8 benchmarks

    -0.66
    • MMLU-Pro: 80.5%
    • GPQA: 67.1%
    • HLE: 4.9%
    • AIME: 19.3%
    • AA-LCR: 50.0%
    • Omniscience Acc.: 24.9%
    • IFBench: 43.0%
  123. 123
    Qwen3 32B

    Alibabaopen6/8 benchmarks

    -0.70
    • GPQA: 66.8%
    • HLE: 7.4%
    • AIME: 72.9%
    • CritPt: 0.3%
    • Omniscience Acc.: 17.4%
    • IFBench: 36.3%
  124. 124
    GPT-4.1 Mini

    OpenAIclosed7/8 benchmarks

    -0.72
    • MMLU-Pro: 78.1%
    • GPQA: 66.4%
    • HLE: 5.0%
    • AIME: 40.2%
    • AA-LCR: 44.0%
    • Omniscience Acc.: 20.3%
    • IFBench: 38.3%
  125. 125
    Gemini 2.5 Flash-Lite

    Googleclosed5/8 benchmarks

    -0.72
    • GPQA: 62.5%
    • HLE: 6.8%
    • AA-LCR: 55.7%
    • Omniscience Acc.: 17.9%
    • IFBench: 49.9%
  126. 126
    Mistral Large 3

    Mistralopen7/8 benchmarks

    -0.72
    • MMLU-Pro: 80.7%
    • GPQA: 68.0%
    • HLE: 4.2%
    • AIME: 38.0%
    • AA-LCR: 36.0%
    • Omniscience Acc.: 25.0%
    • IFBench: 36.2%
  127. 127
    GPT-4o (May 2024)

    OpenAIclosed3/8 benchmarks

    -0.75
    • MMLU-Pro: 74.0%
    • GPQA: 52.6%
    • HLE: 1.8%
  128. 128
    Qwen3 Coder 480B

    Alibabaopen7/8 benchmarks

    -0.76
    • MMLU-Pro: 78.8%
    • GPQA: 61.8%
    • HLE: 4.5%
    • AIME: 39.3%
    • AA-LCR: 45.7%
    • Omniscience Acc.: 15.7%
    • IFBench: 40.5%
  129. 129
    QwQ-32B

    Alibabaopen6/8 benchmarks

    -0.77
    • MMLU-Pro: 76.4%
    • GPQA: 59.3%
    • HLE: 7.4%
    • AIME: 69.5%
    • AA-LCR: 26.7%
    • IFBench: 38.8%
  130. 130
    GLM-4.7 Flash

    Zhipu AIclosed6/8 benchmarks

    -0.82
    • GPQA: 58.1%
    • HLE: 7.6%
    • CritPt: 0.3%
    • AA-LCR: 41.7%
    • Omniscience Acc.: 16.2%
    • IFBench: 60.8%
  131. 131
    INTELLECT-3

    Prime Intellectopen6/8 benchmarks

    -0.82
    • GPQA: 76.1%
    • HLE: 13.1%
    • CritPt: 0.3%
    • AA-LCR: 39.7%
    • Omniscience Acc.: 19.6%
    • IFBench: 34.0%
  132. 132
    Claude 3 Opus

    Anthropicclosed3/8 benchmarks

    -0.86
    • MMLU-Pro: 69.6%
    • GPQA: 48.9%
    • HLE: 2.8%
  133. 133
    Mistral Medium 3.1

    Mistralclosed7/8 benchmarks

    -0.86
    • MMLU-Pro: 68.3%
    • GPQA: 58.8%
    • HLE: 4.7%
    • AIME: 38.3%
    • AA-LCR: 42.7%
    • Omniscience Acc.: 20.8%
    • IFBench: 39.8%
  134. 134
    Sonar

    Perplexityclosed3/8 benchmarks

    -0.87
    • MMLU-Pro: 68.9%
    • GPQA: 47.1%
    • HLE: 4.9%
  135. 135
    Devstral 2

    Mistralopen7/8 benchmarks

    -0.87
    • MMLU-Pro: 76.2%
    • GPQA: 59.4%
    • HLE: 3.6%
    • AIME: 36.7%
    • AA-LCR: 32.3%
    • Omniscience Acc.: 20.8%
    • IFBench: 38.1%
  136. 136
    LFM2.5-8B-A1B

    Liquid AIopen4/8 benchmarks

    -0.88
    • GPQA: 51.3%
    • HLE: 6.9%
    • Omniscience Acc.: 9.3%
    • IFBench: 55.6%
  137. 137
    Ling-2.6 Flash

    InclusionAIclosed5/8 benchmarks

    -0.89
    • GPQA: 59.3%
    • HLE: 6.3%
    • AA-LCR: 31.3%
    • Omniscience Acc.: 15.6%
    • IFBench: 57.4%
  138. 138
    Qwen2.5 72B

    Alibabaopen5/8 benchmarks

    -0.94
    • MMLU-Pro: 71.1%
    • GPQA: 49.1%
    • HLE: 3.6%
    • Omniscience Acc.: 17.5%
    • IFBench: 36.9%
  139. 139
    DeepSeek V3

    DeepSeekopen7/8 benchmarks

    -0.95
    • MMLU-Pro: 75.9%
    • GPQA: 55.7%
    • HLE: 2.9%
    • AIME: 26.0%
    • AA-LCR: 29.3%
    • Omniscience Acc.: 25.5%
    • IFBench: 34.8%
  140. 140
    Gemini 2.0 Flash

    Googleclosed5/8 benchmarks

    -0.96
    • GPQA: 62.3%
    • HLE: 4.3%
    • AA-LCR: 31.3%
    • Omniscience Acc.: 23.5%
    • IFBench: 40.2%
  141. 141
    Qwen3-Omni-30B-A3B-Instruct

    Alibabaopen4/8 benchmarks

    -0.99
    • GPQA: 62.0%
    • HLE: 4.6%
    • Omniscience Acc.: 14.3%
    • IFBench: 31.2%
  142. 142
    Reka Flash 3

    Rekaopen6/8 benchmarks

    -1.02
    • MMLU-Pro: 66.9%
    • GPQA: 52.9%
    • HLE: 4.4%
    • AIME: 33.7%
    • Omniscience Acc.: 13.7%
    • IFBench: 30.4%
  143. 143
    Olmo 3.1 32B Instruct

    Ai2open4/8 benchmarks

    -1.02
    • GPQA: 53.9%
    • HLE: 5.0%
    • Omniscience Acc.: 12.0%
    • IFBench: 39.2%
  144. 144
    Llama 4 Scout

    Metaopen7/8 benchmarks

    -1.03
    • MMLU-Pro: 74.3%
    • GPQA: 58.7%
    • HLE: 3.8%
    • AIME: 14.0%
    • AA-LCR: 27.7%
    • Omniscience Acc.: 15.2%
    • IFBench: 39.5%
  145. 145
    Phi-4

    Microsoftopen6/8 benchmarks

    -1.06
    • MMLU-Pro: 70.4%
    • GPQA: 57.5%
    • HLE: 3.8%
    • AIME: 18.0%
    • Omniscience Acc.: 14.1%
    • IFBench: 23.5%
  146. 146
    Claude Haiku 3.5

    Anthropicclosed3/8 benchmarks

    -1.06
    • MMLU-Pro: 63.4%
    • GPQA: 40.8%
    • HLE: 3.6%
  147. 147
    DeepSeek-R1-Distill-Qwen-32B

    DeepSeekopen6/8 benchmarks

    -1.07
    • MMLU-Pro: 73.9%
    • GPQA: 61.5%
    • HLE: 4.6%
    • AIME: 63.0%
    • AA-LCR: 8.7%
    • IFBench: 22.9%
  148. 148
    Qwen3-Coder 30B-A3B

    Alibabaopen7/8 benchmarks

    -1.07
    • MMLU-Pro: 70.6%
    • GPQA: 51.6%
    • HLE: 3.8%
    • AIME: 29.0%
    • AA-LCR: 32.7%
    • Omniscience Acc.: 16.4%
    • IFBench: 32.7%
  149. 149
    Llama 3.1 405B

    Metaopen7/8 benchmarks

    -1.09
    • MMLU-Pro: 73.3%
    • GPQA: 51.5%
    • HLE: 4.0%
    • AIME: 3.0%
    • AA-LCR: 25.3%
    • Omniscience Acc.: 23.2%
    • IFBench: 39.0%
  150. 150
    Mistral Large 2

    Mistralclosed4/8 benchmarks

    -1.09
    • GPQA: 48.6%
    • HLE: 3.3%
    • Omniscience Acc.: 19.9%
    • IFBench: 31.2%
  151. 151
    Llama 3.3 70B

    Metaopen6/8 benchmarks

    -1.10
    • MMLU-Pro: 68.9%
    • GPQA: 49.8%
    • HLE: 3.6%
    • AA-LCR: 15.7%
    • Omniscience Acc.: 19.0%
    • IFBench: 47.1%
  152. 152
    Ministral 3 14B

    Mistralopen7/8 benchmarks

    -1.10
    • MMLU-Pro: 69.3%
    • GPQA: 57.2%
    • HLE: 4.6%
    • AIME: 30.0%
    • AA-LCR: 26.3%
    • Omniscience Acc.: 13.6%
    • IFBench: 32.0%
  153. 153
    Pixtral Large

    Mistralclosed5/8 benchmarks

    -1.10
    • MMLU-Pro: 70.1%
    • GPQA: 50.5%
    • HLE: 2.8%
    • AIME: 2.3%
    • IFBench: 34.5%
  154. 154
    DeepSeek-R1-Distill-Llama-70B

    DeepSeekopen7/8 benchmarks

    -1.13
    • MMLU-Pro: 79.5%
    • GPQA: 40.2%
    • HLE: 5.1%
    • AIME: 53.7%
    • AA-LCR: 10.0%
    • Omniscience Acc.: 19.2%
    • IFBench: 27.6%
  155. 155
    Jamba 1.5 Large

    AI21open3/8 benchmarks

    -1.13
    • MMLU-Pro: 57.2%
    • GPQA: 42.7%
    • HLE: 4.1%
  156. 156
    Llama 3.1 70B

    Metaopen6/8 benchmarks

    -1.15
    • MMLU-Pro: 66.4%
    • GPQA: 40.9%
    • HLE: 4.5%
    • AIME: 4.0%
    • Omniscience Acc.: 19.7%
    • IFBench: 34.4%
  157. 157
    Command A

    Cohereclosed7/8 benchmarks

    -1.16
    • MMLU-Pro: 71.2%
    • GPQA: 52.7%
    • HLE: 4.0%
    • AIME: 13.0%
    • AA-LCR: 21.3%
    • Omniscience Acc.: 16.4%
    • IFBench: 36.5%
  158. 158
    Llama 3 70B

    Metaopen4/8 benchmarks

    -1.16
    • GPQA: 37.9%
    • HLE: 4.5%
    • Omniscience Acc.: 17.7%
    • IFBench: 37.1%
  159. 159
    Granite 4.2 3B

    IBMopen4/8 benchmarks

    -1.16
    • GPQA: 55.9%
    • HLE: 6.6%
    • AA-LCR: 24.3%
    • Omniscience Acc.: 9.2%
  160. 160
    Claude 3 Sonnet

    Anthropicclosed3/8 benchmarks

    -1.16
    • MMLU-Pro: 57.9%
    • GPQA: 40.0%
    • HLE: 3.6%
  161. 161
    GPT-4

    OpenAIclosed4/8 benchmarks

    -1.18
    • MMLU-Pro: 56.2%
    • GPQA: 34.9%
    • Omniscience Acc.: 21.0%
    • IFBench: 33.2%
  162. 162
    Mistral Small 3.2

    Mistralopen7/8 benchmarks

    -1.18
    • MMLU-Pro: 69.1%
    • GPQA: 50.5%
    • HLE: 4.3%
    • AIME: 27.0%
    • AA-LCR: 20.3%
    • Omniscience Acc.: 14.8%
    • IFBench: 33.5%
  163. 163
    GPT-4o Mini

    OpenAIclosed5/8 benchmarks

    -1.20
    • MMLU-Pro: 64.8%
    • GPQA: 42.6%
    • HLE: 4.2%
    • AIME: 14.7%
    • IFBench: 31.0%
  164. 164
    DeepSeek-R1 Distill Qwen 14B

    DeepSeekopen6/8 benchmarks

    -1.21
    • MMLU-Pro: 74.0%
    • GPQA: 48.4%
    • HLE: 4.1%
    • AIME: 55.7%
    • AA-LCR: 10.3%
    • IFBench: 22.1%
  165. 165
    Gemini 1.5 Flash-8B

    Googleclosed3/8 benchmarks

    -1.22
    • MMLU-Pro: 56.9%
    • GPQA: 35.9%
    • HLE: 4.7%
  166. 166
    GPT-4.1 Nano

    OpenAIclosed7/8 benchmarks

    -1.24
    • MMLU-Pro: 65.7%
    • GPQA: 51.2%
    • HLE: 3.8%
    • AIME: 24.0%
    • AA-LCR: 20.3%
    • Omniscience Acc.: 13.7%
    • IFBench: 32.0%
  167. 167
    LFM2.5-1.2B-Instruct

    Liquid AIopen4/8 benchmarks

    -1.24
    • GPQA: 32.6%
    • HLE: 6.7%
    • Omniscience Acc.: 7.0%
    • IFBench: 43.8%
  168. 168
    Ministral 3 8B

    Mistralopen7/8 benchmarks

    -1.24
    • MMLU-Pro: 64.2%
    • GPQA: 47.1%
    • HLE: 4.3%
    • AIME: 31.7%
    • AA-LCR: 25.7%
    • Omniscience Acc.: 13.0%
    • IFBench: 29.1%
  169. 169
    Mistral Small

    Mistralclosed3/8 benchmarks

    -1.26
    • MMLU-Pro: 52.9%
    • GPQA: 38.1%
    • HLE: 4.3%
  170. 170
    Olmo 3 7B Instruct

    Ai2open4/8 benchmarks

    -1.28
    • GPQA: 40.0%
    • HLE: 5.8%
    • Omniscience Acc.: 7.4%
    • IFBench: 32.8%
  171. 171
    Mixtral 8x22B

    Mistralopen3/8 benchmarks

    -1.32
    • MMLU-Pro: 53.7%
    • GPQA: 33.2%
    • HLE: 4.0%
  172. 172
    Claude 3 Haiku

    Anthropicclosed5/8 benchmarks

    -1.32
    • GPQA: 37.4%
    • HLE: 4.1%
    • AA-LCR: 27.7%
    • Omniscience Acc.: 17.6%
    • IFBench: 36.1%
  173. 173
    Mistral Large

    Mistralclosed3/8 benchmarks

    -1.33
    • MMLU-Pro: 51.5%
    • GPQA: 35.1%
    • HLE: 3.5%
  174. 174
    Llama-3.1-Nemotron-70B Instruct

    NVIDIAopen7/8 benchmarks

    -1.33
    • MMLU-Pro: 69.0%
    • GPQA: 46.5%
    • HLE: 4.2%
    • AIME: 11.0%
    • AA-LCR: 8.3%
    • Omniscience Acc.: 17.8%
    • IFBench: 30.7%
  175. 175
    Gemma 3 27B

    Googleopen7/8 benchmarks

    -1.37
    • MMLU-Pro: 67.5%
    • GPQA: 42.8%
    • HLE: 4.4%
    • AIME: 20.7%
    • AA-LCR: 7.3%
    • Omniscience Acc.: 13.0%
    • IFBench: 31.8%
  176. 176
    Devstral Small

    Mistralopen5/8 benchmarks

    -1.39
    • GPQA: 41.4%
    • HLE: 3.8%
    • AA-LCR: 18.7%
    • Omniscience Acc.: 14.7%
    • IFBench: 34.6%
  177. 177
    Granite 4.1 8B

    IBMopen5/8 benchmarks

    -1.40
    • GPQA: 43.3%
    • HLE: 3.8%
    • AA-LCR: 13.3%
    • Omniscience Acc.: 12.3%
    • IFBench: 38.6%
  178. 178
    Claude 2.1

    Anthropicclosed3/8 benchmarks

    -1.40
    • MMLU-Pro: 49.5%
    • GPQA: 31.9%
    • HLE: 3.9%
  179. 179
    Phi-4-multimodal

    Microsoftopen3/8 benchmarks

    -1.41
    • MMLU-Pro: 48.5%
    • GPQA: 31.5%
    • HLE: 5.0%
  180. 180
    DeepSeek-R1 Distill Llama 8B

    DeepSeekopen4/8 benchmarks

    -1.41
    • MMLU-Pro: 54.3%
    • GPQA: 30.2%
    • AIME: 41.3%
    • IFBench: 17.6%
  181. 181
    Apertus 70B Instruct

    Swiss AI Initiativeopen4/8 benchmarks

    -1.45
    • GPQA: 27.2%
    • HLE: 5.5%
    • Omniscience Acc.: 11.6%
    • IFBench: 25.9%
  182. 182
    OLMo 2 32B

    Ai2open5/8 benchmarks

    -1.45
    • MMLU-Pro: 51.1%
    • GPQA: 32.8%
    • HLE: 3.6%
    • AIME: 3.3%
    • IFBench: 38.1%
  183. 183
    Kimi Linear 48B A3B Instruct

    Moonshotopen4/8 benchmarks

    -1.45
    • GPQA: 41.2%
    • HLE: 2.5%
    • AA-LCR: 28.0%
    • IFBench: 28.1%
  184. 184
    Llama 3 8B

    Metaopen4/8 benchmarks

    -1.45
    • GPQA: 29.6%
    • HLE: 5.1%
    • Omniscience Acc.: 10.4%
    • IFBench: 24.6%
  185. 185
    Gemma 3 12B

    Googleopen7/8 benchmarks

    -1.48
    • MMLU-Pro: 60.6%
    • GPQA: 34.9%
    • HLE: 4.2%
    • AIME: 18.3%
    • AA-LCR: 8.3%
    • Omniscience Acc.: 10.3%
    • IFBench: 36.7%
  186. 186
    DeepSeek Coder V2 Lite

    DeepSeekopen3/8 benchmarks

    -1.49
    • MMLU-Pro: 42.9%
    • GPQA: 31.9%
    • HLE: 5.4%
  187. 187
    Apertus 8B Instruct

    Swiss AI Initiativeopen4/8 benchmarks

    -1.53
    • GPQA: 25.6%
    • HLE: 5.0%
    • Omniscience Acc.: 9.7%
    • IFBench: 22.4%
  188. 188
    Ministral 3 3B

    Mistralopen7/8 benchmarks

    -1.56
    • MMLU-Pro: 52.4%
    • GPQA: 35.8%
    • HLE: 5.4%
    • AIME: 22.0%
    • AA-LCR: 17.0%
    • Omniscience Acc.: 9.0%
    • IFBench: 26.8%
  189. 189
    Gemini 1.0 Pro

    Googleclosed3/8 benchmarks

    -1.56
    • MMLU-Pro: 43.1%
    • GPQA: 27.7%
    • HLE: 4.2%
  190. 190
    DBRX Instruct

    Databricksopen3/8 benchmarks

    -1.56
    • MMLU-Pro: 39.7%
    • GPQA: 33.1%
    • HLE: 2.9%
  191. 191
    Mixtral 8x7B

    Mistralopen3/8 benchmarks

    -1.61
    • MMLU-Pro: 38.7%
    • GPQA: 29.2%
    • HLE: 4.7%
  192. 192
    Mistral 7B

    Mistralopen4/8 benchmarks

    -1.65
    • GPQA: 17.7%
    • HLE: 4.6%
    • Omniscience Acc.: 9.0%
    • IFBench: 19.9%
  193. 193
    Phi-3 Mini 3.8B

    Microsoftopen5/8 benchmarks

    -1.67
    • MMLU-Pro: 43.5%
    • GPQA: 31.9%
    • HLE: 5.0%
    • AIME: 0.3%
    • IFBench: 23.9%
  194. 194
    Phi-4-mini

    Microsoftopen7/8 benchmarks

    -1.68
    • MMLU-Pro: 52.8%
    • GPQA: 33.1%
    • HLE: 4.5%
    • AIME: 6.7%
    • AA-LCR: 15.3%
    • Omniscience Acc.: 9.5%
    • IFBench: 21.1%
  195. 195
    Llama 3.2 11B Vision

    Metaopen5/8 benchmarks

    -1.68
    • GPQA: 22.1%
    • HLE: 5.5%
    • AA-LCR: 12.7%
    • Omniscience Acc.: 10.6%
    • IFBench: 30.4%
  196. 196
    Llama 3.1 8B

    Metaopen7/8 benchmarks

    -1.71
    • MMLU-Pro: 48.3%
    • GPQA: 25.9%
    • HLE: 5.3%
    • AIME: 4.3%
    • AA-LCR: 18.0%
    • Omniscience Acc.: 8.5%
    • IFBench: 28.6%
  197. 197
    Granite 4.0 Micro

    IBMopen7/8 benchmarks

    -1.77
    • MMLU-Pro: 44.7%
    • GPQA: 33.6%
    • HLE: 5.0%
    • AIME: 6.0%
    • AA-LCR: 7.0%
    • Omniscience Acc.: 9.3%
    • IFBench: 24.8%
  198. 198
    Gemma 3 4B

    Googleopen7/8 benchmarks

    -1.78
    • MMLU-Pro: 43.6%
    • GPQA: 29.1%
    • HLE: 5.3%
    • AIME: 12.7%
    • AA-LCR: 6.7%
    • Omniscience Acc.: 7.7%
    • IFBench: 28.3%
  199. 199
    Llama 3.2 3B

    Metaopen4/8 benchmarks

    -1.82
    • GPQA: 25.5%
    • HLE: 5.4%
    • AA-LCR: 4.3%
    • IFBench: 26.2%
  200. 200
    Llama 3.2 1B

    Metaopen5/8 benchmarks

    -1.85
    • GPQA: 19.6%
    • HLE: 5.5%
    • AA-LCR: 6.7%
    • Omniscience Acc.: 7.0%
    • IFBench: 22.8%

Back to Reasoning & knowledge benchmarks