LLMcompare

Search

Search for a command to run...

Reasoning & knowledge

CritPt

Complex Research using Integrated Thinking — Physics Test: 71 unpublished research-level physics challenges (decomposed into 190 checkpoint tasks) across 11 subfields, authored by 50+ working physicists. Reported here as Artificial Analysis's independently-run accuracy on the composite challenges; tool access materially changes results, so runs with and without code execution are not comparable.

How models are tested

Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.

Category
Reasoning & knowledge
Metric
Percent
Direction
Higher is better
Coverage
99 / 318Models in this catalog with a published score
Updated
Catalog snapshot date

Scores

  1. 1
    GPT-5.6 Sol

    OpenAIclosed

    32.3%
  2. 2
    GPT-6 Astra

    OpenAIclosed

    31.7%
  3. 3
    GPT-5.5 Pro

    OpenAIclosed

    30.6%
  4. 4
    GPT-5.6 Terra

    OpenAIclosed

    30.0%
  5. 5
    GPT-5.4 Pro

    OpenAIclosed

    30.0%
  6. 6
    Claude Fable 5.1

    Anthropicclosed

    29.7%
  7. 7
    Claude Opus 5

    Anthropicclosed

    29.1%
  8. 8
    Claude Fable 5

    Anthropicclosed

    28.6%
  9. 9
    GPT-5.5

    OpenAIclosed

    27.1%
  10. 10
    Muse Spark 1.3

    Metaclosed

    24.9%
  11. 11
    GPT-5.4

    OpenAIclosed

    23.4%
  12. 12
    Kimi K3

    Moonshotopen

    23.4%
  13. 13
    Claude Opus 4.8

    Anthropicclosed

    20.9%
  14. 14
    GLM-5.2

    Zhipu AIopen

    20.9%
  15. 15
    GPT-5.6 Luna

    OpenAIclosed

    20.6%
  16. 16
    GLM-5.3

    Zhipu AIopen

    19.1%
  17. 17
    Gemini 3.8 Flash

    Googleclosed

    18.3%
  18. 18
    Grok 4.7

    xAIclosed

    18.0%
  19. 19
    DeepSeek V4 Pro 0813

    DeepSeekclosed

    18.0%
  20. 20
    Muse Spark 1.2

    Metaclosed

    17.7%
  21. 21
    Qwen3.8 Max

    Alibabaopen

    17.7%
  22. 22
    Grok 4.6

    xAIclosed

    17.1%
  23. 23
    Claude Sonnet 5

    Anthropicclosed

    16.9%
  24. 2416.6%
  25. 25
    Grok 4.5

    xAIclosed

    15.4%
  26. 26
    GLM-5.3 Flash

    Zhipu AIopen

    15.4%
  27. 27
    Muse Spark 1.1

    Metaclosed

    15.1%
  28. 28
    Gemini 3.7 Flash

    Googleclosed

    14.3%
  29. 2914.3%
  30. 30
    Qwen3.7 Max

    Alibabaclosed

    13.4%
  31. 31
    Gemini 3.5 Flash

    Googleclosed

    13.1%
  32. 32
    DeepSeek V4 Pro

    DeepSeekopen

    12.9%
  33. 33
    Claude Opus 4.6

    Anthropicclosed

    12.6%
  34. 34
    Claude Opus 4.7

    Anthropicclosed

    12.0%
  35. 3511.1%
  36. 36
    Gemini 3.6 Flash

    Googleclosed

    10.6%
  37. 37
    Kimi K2.7 Code

    Moonshotopen

    10.0%
  38. 38
    GPT-5.4 Mini

    OpenAIclosed

    10.0%
  39. 39
    GPT-5.4 Nano

    OpenAIclosed

    9.3%
  40. 40
    Qwen3.7 Plus

    Alibabaclosed

    9.1%
  41. 41
    Gemini 3 Flash

    Googleclosed

    8.6%
  42. 42
    Inkling-Small

    Thinking Machinesopen

    8.3%
  43. 43
    Grok 4.3

    xAIclosed

    8.0%
  44. 44
    Kimi K2.6

    Moonshotclosed

    8.0%
  45. 45
    DeepSeek V4 Flash

    DeepSeekopen

    7.1%
  46. 46
    GPT-5

    OpenAIclosed

    5.7%
  47. 47
    Qwen3.8 27B

    Alibabaopen

    5.4%
  48. 48
    Solar Pro 4

    Upstageclosed

    5.4%
  49. 49
    Inkling

    Thinking Machinesopen

    5.4%
  50. 50
    Hy3

    Tencentopen

    4.9%
  51. 51
    Claude Opus 4.5

    Anthropicclosed

    4.6%
  52. 52
    K2 Horizon 375B A23B

    MBZUAI Institute of Foundation Modelsopen

    4.6%
  53. 53
    GLM-5.1

    Zhipu AIopen

    4.6%
  54. 54
    Hunyuan 3 Preview

    Tencentclosed

    4.6%
  55. 55
    MiMo-V2.5-Pro

    Xiaomiopen

    4.0%
  56. 56
    MiMo-V2.5

    Xiaomiopen

    3.7%
  57. 57
    MiniMax M3

    MiniMaxopen

    3.7%
  58. 58
    Ring-2.6-1T

    InclusionAIopen

    3.7%
  59. 59
    Claude Sonnet 4.6

    Anthropicclosed

    3.1%
  60. 60
    Kimi K2.5

    Moonshotopen

    3.1%
  61. 613.1%
  62. 62
    DeepSeek V3.2

    DeepSeekopen

    2.9%
  63. 63
    Qwen3.6 Plus

    Alibabaclosed

    2.9%
  64. 64
    MiMo-V2-Flash

    Xiaomiopen

    2.9%
  65. 65
    Grok 4 Fast

    xAIclosed

    2.9%
  66. 66
    Gemini 2.5 Pro

    Googleclosed

    2.6%
  67. 67
    Muse Glimmer

    Metaopen

    2.6%
  68. 68
    LongCat-2.0

    Meituanopen

    2.6%
  69. 69
    Step-3.5 Flash

    StepFunclosed

    2.5%
  70. 70
    Grok 4

    xAIclosed

    2.0%
  71. 71
    DeepSeek V3.1

    DeepSeekopen

    2.0%
  72. 72
    GLM-5

    Zhipu AIopen

    2.0%
  73. 731.7%
  74. 74
    GLM-4.7

    Zhipu AIopen

    1.7%
  75. 75
    Ling-3.0 Flash

    InclusionAIopen

    1.7%
  76. 76
    Gemma 4 31B

    Googleopen

    1.4%
  77. 77
    DeepSeek R1-0528

    DeepSeekopen

    1.4%
  78. 78
    gpt-oss-20B

    OpenAIopen

    1.4%
  79. 79
    o3

    OpenAIclosed

    1.1%
  80. 80
    Gemini 2.5 Flash

    Googleclosed

    1.1%
  81. 81
    Qwen3.6 27B

    Alibabaopen

    1.1%
  82. 82
    MiniMax M2.5

    MiniMaxopen

    1.1%
  83. 83
    gpt-oss-120B

    OpenAIopen

    1.1%
  84. 841.1%
  85. 85
    Claude 3.7 Sonnet

    Anthropicclosed

    0.9%
  86. 860.9%
  87. 87
    Mercury 2

    Inception Labsclosed

    0.8%
  88. 88
    o4-mini

    OpenAIclosed

    0.6%
  89. 89
    DeepSeek R1

    DeepSeekopen

    0.6%
  90. 90
    MiniMax M2.7

    MiniMaxclosed

    0.6%
  91. 91
    Qwen3.6 35B A3B

    Alibabaopen

    0.3%
  92. 92
    Qwen3 32B

    Alibabaopen

    0.3%
  93. 93
    Mistral Small 4

    Mistralopen

    0.3%
  94. 94
    o1

    OpenAIclosed

    0.3%
  95. 950.3%
  96. 960.3%
  97. 97
    GLM-4.7 Flash

    Zhipu AIclosed

    0.3%
  98. 98
    Ling-2.6 1T

    InclusionAIopen

    0.3%
  99. 99
    INTELLECT-3

    Prime Intellectopen

    0.3%

Back to all benchmarks