LLMcompare

Search

Search for a command to run...

Arena

LMArena Elo

Blind pairwise human preference rating from the LMArena (Chatbot Arena) leaderboard; ratings drift with traffic, model aliases, sampling, and leaderboard methodology.

How models are tested

Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.

Category
Arena
Metric
Elo
Direction
Higher is better
Coverage
165 / 318Models in this catalog with a published score
Updated
Catalog snapshot date

Scores

  1. 1
    Claude Fable 5

    Anthropicclosed

    1,506
  2. 2
    Muse Spark 1.2

    Metaclosed

    1,500
  3. 3
    Claude Fable 5.1

    Anthropicclosed

    1,499
  4. 4
    Claude Opus 4.6

    Anthropicclosed

    1,497
  5. 5
    Claude Opus 4.7

    Anthropicclosed

    1,494
  6. 6
    Gemini 3.8 Flash

    Googleclosed

    1,493
  7. 7
    Claude Opus 5

    Anthropicclosed

    1,493
  8. 8
    Muse Spark 1.1

    Metaclosed

    1,493
  9. 9
    Gemini 3.7 Flash

    Googleclosed

    1,490
  10. 10
    Gemini 3.1 Pro

    Googleclosed

    1,487
  11. 11
    Gemini 3 Pro

    Googleclosed

    1,486
  12. 12
    Kimi K3

    Moonshotopen

    1,485
  13. 13
    GPT-5.6 Sol

    OpenAIclosed

    1,484
  14. 14
    GLM-5.3

    Zhipu AIopen

    1,483
  15. 15
    Qwen3.8 Max

    Alibabaopen

    1,481
  16. 16
    Gemini 3.6 Flash

    Googleclosed

    1,480
  17. 17
    Gemini 3.5 Flash

    Googleclosed

    1,478
  18. 18
    GPT-5.5

    OpenAIclosed

    1,476
  19. 19
    GLM-5.3 Flash

    Zhipu AIopen

    1,475
  20. 20
    Gemini 3 Flash

    Googleclosed

    1,474
  21. 21
    Claude Opus 4.8

    Anthropicclosed

    1,473
  22. 22
    Qwen3.7 Max

    Alibabaclosed

    1,473
  23. 23
    Claude Sonnet 4.6

    Anthropicclosed

    1,473
  24. 24
    GLM-5.2

    Zhipu AIopen

    1,472
  25. 25
    Claude Opus 4.5

    Anthropicclosed

    1,470
  26. 26
    Grok 4.5

    xAIclosed

    1,468
  27. 27
    ERNIE 5.1

    Baiduclosed

    1,468
  28. 28
    MiMo-V2.5-Pro

    Xiaomiopen

    1,467
  29. 29
    GPT-5.6 Terra

    OpenAIclosed

    1,466
  30. 30
    GPT-5.4

    OpenAIclosed

    1,466
  31. 31
    GLM-5.1

    Zhipu AIopen

    1,466
  32. 32
    Claude Sonnet 5

    Anthropicclosed

    1,461
  33. 33
    Kimi K2.6

    Moonshotclosed

    1,460
  34. 34
    Grok 4.1

    xAIclosed

    1,459
  35. 35
    GLM-5

    Zhipu AIopen

    1,458
  36. 36
    DeepSeek V4 Pro

    DeepSeekopen

    1,457
  37. 371,456
  38. 38
    Hy3

    Tencentopen

    1,456
  39. 39
    Grok 4.6

    xAIclosed

    1,456
  40. 40
    Qwen3.7 Plus

    Alibabaclosed

    1,456
  41. 41
    Claude Sonnet 4.5

    Anthropicclosed

    1,455
  42. 42
    GPT-5.6 Luna

    OpenAIclosed

    1,453
  43. 43
    Gemma 4 31B

    Googleopen

    1,451
  44. 44
    GPT-5.4 Mini

    OpenAIclosed

    1,448
  45. 45
    Claude Opus 4.1

    Anthropicclosed

    1,448
  46. 46
    Gemini 2.5 Pro

    Googleclosed

    1,446
  47. 47
    GPT-4.5

    OpenAIclosed

    1,445
  48. 48
    Qwen3.6 Plus

    Alibabaclosed

    1,443
  49. 49
    Grok 4.3

    xAIclosed

    1,443
  50. 501,442
  51. 51
    GLM-4.7

    Zhipu AIopen

    1,442
  52. 52
    MiniMax M3

    MiniMaxopen

    1,441
  53. 53
    Inkling

    Thinking Machinesopen

    1,440
  54. 54
    Gemma 4 26B

    Googleopen

    1,438
  55. 55
    Qwen3.8 27B

    Alibabaopen

    1,437
  56. 56
    DeepSeek V4 Flash

    DeepSeekopen

    1,436
  57. 57
    GPT-5

    OpenAIclosed

    1,435
  58. 58
    MiMo-V2.5

    Xiaomiopen

    1,434
  59. 591,432
  60. 60
    o3

    OpenAIclosed

    1,432
  61. 61
    Muse Glimmer

    Metaopen

    1,427
  62. 621,426
  63. 63
    DeepSeek V3.2

    DeepSeekopen

    1,425
  64. 64
    Qwen3 Max

    Alibabaclosed

    1,424
  65. 65
    DeepSeek R1-0528

    DeepSeekopen

    1,421
  66. 66
    DeepSeek V3.1

    DeepSeekopen

    1,417
  67. 67
    MiniMax M2.7

    MiniMaxclosed

    1,415
  68. 68
    Claude Haiku 4.5

    Anthropicclosed

    1,415
  69. 69
    GPT-4.1

    OpenAIclosed

    1,415
  70. 70
    Claude Opus 4

    Anthropicclosed

    1,414
  71. 71
    Mistral Large 3

    Mistralopen

    1,413
  72. 72
    Hunyuan 3 Preview

    Tencentclosed

    1,413
  73. 73
    Grok 3

    xAIclosed

    1,412
  74. 74
    Grok 4

    xAIclosed

    1,411
  75. 75
    Gemini 2.5 Flash

    Googleclosed

    1,410
  76. 76
    Inkling-Small

    Thinking Machinesopen

    1,405
  77. 77
    GPT-5.4 Nano

    OpenAIclosed

    1,402
  78. 78
    o1

    OpenAIclosed

    1,402
  79. 791,401
  80. 801,399
  81. 81
    DeepSeek R1

    DeepSeekopen

    1,398
  82. 82
    Qwen3.5 Flash

    Alibabaclosed

    1,397
  83. 83
    Step-3.5 Flash

    StepFunclosed

    1,394
  84. 84
    o4-mini

    OpenAIclosed

    1,391
  85. 85
    Claude Sonnet 4

    Anthropicclosed

    1,391
  86. 86
    MiniMax M2.5

    MiniMaxopen

    1,390
  87. 87
    GPT-5 Mini

    OpenAIclosed

    1,390
  88. 88
    o1 Preview

    OpenAIclosed

    1,388
  89. 89
    Qwen3 Coder 480B

    Alibabaopen

    1,388
  90. 90
    GPT-4.1 Mini

    OpenAIclosed

    1,383
  91. 91
    Solar Pro 4

    Upstageclosed

    1,376
  92. 92
    Qwen3 235B-A22B

    Alibabaopen

    1,375
  93. 931,374
  94. 94
    Claude 3.7 Sonnet

    Anthropicclosed

    1,372
  95. 951,369
  96. 96
    GLM-4.7 Flash

    Zhipu AIclosed

    1,366
  97. 97
    Gemma 3 27B

    Googleopen

    1,365
  98. 98
    Gemini 2.0 Flash

    Googleclosed

    1,360
  99. 99
    DeepSeek V3

    DeepSeekopen

    1,358
  100. 100
    Mistral Small

    Mistralclosed

    1,357
  101. 101
    INTELLECT-3

    Prime Intellectopen

    1,356
  102. 102
    Command A

    Cohereclosed

    1,354
  103. 103
    gpt-oss-120B

    OpenAIopen

    1,352
  104. 104
    o3-mini

    OpenAIclosed

    1,348
  105. 105
    Qwen3 32B

    Alibabaopen

    1,347
  106. 106
    GPT-4o (May 2024)

    OpenAIclosed

    1,346
  107. 107
    Claude 3.5 Sonnet

    Anthropicclosed

    1,343
  108. 108
    Gemma 3 12B

    Googleopen

    1,342
  109. 109
    GPT-5 Nano

    OpenAIclosed

    1,338
  110. 110
    o1 Mini

    OpenAIclosed

    1,337
  111. 111
    QwQ-32B

    Alibabaopen

    1,336
  112. 112
    Grok 2

    xAIclosed

    1,336
  113. 1131,335
  114. 114
    Yi Lightning

    01.AIclosed

    1,328
  115. 1151,327
  116. 116
    Claude Haiku 3.5

    Anthropicclosed

    1,324
  117. 117
    GPT-4 Turbo

    OpenAIclosed

    1,324
  118. 118
    GPT-4.1 Nano

    OpenAIclosed

    1,322
  119. 119
    Claude 3 Opus

    Anthropicclosed

    1,322
  120. 1201,322
  121. 121
    GPT-4o Mini

    OpenAIclosed

    1,318
  122. 1221,318
  123. 123
    gpt-oss-20B

    OpenAIopen

    1,317
  124. 124
    Grok 2 Mini

    xAIclosed

    1,308
  125. 125
    DeepSeek-V2.5

    DeepSeekopen

    1,307
  126. 1261,307
  127. 1271,306
  128. 128
    Gemma 3 4B

    Googleopen

    1,303
  129. 129
    Qwen2.5 72B

    Alibabaopen

    1,303
  130. 1301,299
  131. 1311,293
  132. 1321,289
  133. 133
    Gemma 2 27B

    Googleopen

    1,289
  134. 134
    Reka Core

    Rekaclosed

    1,288
  135. 135
    GPT-4

    OpenAIclosed

    1,288
  136. 136
    Claude 3 Sonnet

    Anthropicclosed

    1,281
  137. 137
    Llama 3 70B

    Metaopen

    1,276
  138. 1381,276
  139. 139
    Reka Flash

    Rekaclosed

    1,272
  140. 1401,271
  141. 141
    Gemma 2 9B

    Googleopen

    1,267
  142. 142
    DeepSeek Coder V2

    DeepSeekopen

    1,265
  143. 1431,262
  144. 144
    Claude 3 Haiku

    Anthropicclosed

    1,261
  145. 1451,259
  146. 146
    Phi-4

    Microsoftopen

    1,256
  147. 1471,250
  148. 148
    Mistral Large

    Mistralclosed

    1,242
  149. 149
    Mixtral 8x22B

    Mistralopen

    1,229
  150. 150
    GPT-3.5 Turbo

    OpenAIclosed

    1,225
  151. 151
    Llama 3 8B

    Metaopen

    1,223
  152. 1521,213
  153. 153
    Llama 3.1 8B

    Metaopen

    1,211
  154. 1541,208
  155. 155
    Gemma 2 2B

    Googleopen

    1,200
  156. 156
    Phi-3 Medium 14B

    Microsoftopen

    1,198
  157. 157
    Mixtral 8x7B

    Mistralopen

    1,197
  158. 158
    DBRX Instruct

    Databricksopen

    1,195
  159. 1591,180
  160. 160
    Llama 3.2 3B

    Metaopen

    1,167
  161. 1611,137
  162. 162
    Phi-3 Mini 3.8B

    Microsoftopen

    1,128
  163. 1631,119
  164. 164
    Llama 3.2 1B

    Metaopen

    1,111
  165. 165
    Mistral 7B

    Mistralopen

    1,110

Back to all benchmarks