benchgap
Knowledge & reasoning

Artificial Analysis Intelligence Index leaderboard

As of 2026-10-07, the highest measured score on Artificial Analysis Intelligence Index is 58.9% by GPT-5.6 Sol. 45 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1GPT-5.6 Sol58.9%measured
2Claude Opus 5.557.6%measured
3Claude Sonnet 5.556.0%measured
4GPT-5.6 Terra54.9%measured
5Claude Fable 5.153.3%measured
6DeepSeek V4 Pro 081353.2%measured
7GPT-6 Astra52.7%measured
8Gemini 4 Argon52.6%measured
9GPT-6.1 Sol51.8%measured
10Claude Mythos 551.5%estimated ± 5.1 pp, medium confidence
11GPT-5.6 Luna51.2%measured
12Claude Opus 550.8%measured
13Gemini 3.5 Flash50.2%measured
14GPT-5.5 Pro49.7%estimated ± 5.1 pp, medium confidence
15Claude Fable 549.6%measured
16GPT-5.4 Pro49.4%estimated ± 5.1 pp, medium confidence
17Muse Spark 1.348.1%measured
18GPT-6 Sol47.6%measured
19Gemini 3 Pro Deep Think46.8%estimated ± 5.1 pp, medium confidence
20Grok 4.746.5%measured
21MiMo-V2.6-Pro46.3%measured
22dots3-note Preview45.8%estimated ± 7.0 pp, medium confidence
23Qwen3.8 Max Preview45.4%measured
24GLM-5.344.8%measured
25Grok 4.644.3%measured
26Step 5 Preview43.7%measured
27Kimi K343.6%measured
28Claude Haiku 5.543.4%measured
29Sakana Fugu-Ultra43.3%estimated ± 5.1 pp, medium confidence
30Pareto 26.942.4%estimated ± 5.1 pp, medium confidence
31GLM-5.3-Flash41.8%measured
32Claude Opus 4.841.8%measured
33Hy3 Preview41.2%measured
34Ling 3.1 Flash41.1%measured
35Gemini 3.8 Flash40.9%measured
36Sakana Fugu40.7%estimated ± 5.1 pp, medium confidence
37Claude Opus 4.7 (Adaptive)40.7%measured
38Hy4 preview40.4%estimated ± 5.1 pp, medium confidence
39Qwen3.8-Flash-Next39.8%measured
40Muse Spark 1.239.6%measured
41Pareto 26.10 Preview39.6%estimated ± 7.4 pp, medium confidence
42DeepSeek V4.1 Flash39.5%measured
43Gemini 3.7 Flash39.1%measured
44GPT-5.439.0%measured
45Grok 4.538.8%measured
46Mistral Large 438.4%measured
47GPT-5.538.4%measured
48Ornith-1.5-397B38.3%estimated ± 5.1 pp, medium confidence
49Claude Sonnet 538.2%measured
50GPT-6 Luna38.1%measured
51MiMo-V2.6-Flash37.9%measured
52Grok 4.337.6%measured
53Qwen3.8 Max37.4%estimated ± 5.1 pp, medium confidence
54Qwen3.8-Omni-Flash34.9%estimated ± 6.2 pp, medium confidence
55DeepSeek V4 Flash 073134.3%measured
56Agents-A134.1%estimated ± 8.7 pp, low confidence
57Gemini 3.6 Flash34.0%measured
58Muse Spark 1.133.7%measured
59GLM-5.233.7%measured
60Qwen3.8-27B33.7%measured
61GPT-5.3 Codex32.5%measured
62Claude Opus 4.6 (Adaptive)32.0%measured
63Interfaze Beta31.5%estimated ± 6.2 pp, medium confidence
64Muse Spark31.3%measured
65Claude Opus 4.730.9%measured
66Beam30.8%estimated ± 5.1 pp, medium confidence
67GPT-5.230.5%measured
68Gemini 3.1 Pro29.7%measured
69Qwen3.7 Max29.5%measured
70MiniMax M329.2%measured
71Claude Opus 4.5 Thinking29.1%measured
72MiMo-V2-Pro28.6%measured
73GPT-5.2-Codex28.5%measured
74Qwen 3.6 Max (preview)28.4%measured
75Solar Pro 428.2%measured
76Gemini 3 Pro28.0%measured
77GLM-527.9%measured
78Qwen3.6 Plus27.0%measured
79Kimi K2.627.0%measured
80Grok 4.2026.9%estimated ± 5.1 pp, medium confidence
81Quasar 438B26.7%measured
82GLM-5-Turbo26.6%measured
83Apodex 1.126.4%measured
84Apodex 1.1 Mini26.4%measured
85Claude Opus 4.626.4%measured
86GLM-5.126.1%measured
87MiMo-V2.5-Pro26.0%measured
88Kimi K2.7 Code25.8%measured
89Inkling-Small25.7%measured
90Hy325.3%measured
91Qwen3.7 Plus25.2%measured
92Inkling25.0%measured
93Solar Open 224.8%estimated ± 5.1 pp, medium confidence
94GPT-5.124.7%measured
95Claude Sonnet 4.624.7%measured
96Ling 3.0 Flash VL24.6%measured
97GPT-5.4 mini24.1%measured
98MiMo-V2-Omni23.9%measured
99GPT-5.1-Codex23.7%measured
100GPT-5.1-Codex-Max23.7%measured
101Claude Opus 4.523.7%measured
102GLM-5V-Turbo23.5%measured
103Kimi K2.523.5%measured
104Kimi K2.5 (Reasoning)23.5%measured
105Seed 2.1 Pro23.3%estimated ± 3.9 pp, medium confidence
106GPT-5 (high)23.0%measured
107Nemotron 3 Ultra22.9%measured
108Qwen3.5-27B22.9%measured
109GPT-5 (medium)22.9%measured
110Claude 4.1 Opus Thinking22.9%measured
111MiniMax M2.722.8%measured
112Command A+22.5%measured
113Grok 422.5%measured
114Seed 2.1 Turbo22.5%estimated ± 3.9 pp, medium confidence
115Ornith-1.5-35B-A3B22.4%estimated ± 5.1 pp, medium confidence
116Qwen3.5 Flash22.3%estimated ± 7.9 pp, medium confidence
117GLM-4.722.2%measured
118Gemini 3.5 Flash-Lite22.2%measured
119o3-pro21.9%measured
120Claude Sonnet 4.5 Thinking21.7%estimated ± 7.0 pp, medium confidence
121A.X K221.5%measured
122Qwen3.5 397B21.4%measured
123Qwen3.5 397B (Reasoning)21.4%measured
124Qwen3.6-27B21.4%measured
125Qwen3 235B 250721.3%estimated ± 3.9 pp, medium confidence
126MiMo-V2.520.9%estimated ± 7.9 pp, medium confidence
127GPT-5.4 nano20.7%measured
128Gemini 3.1 Flash-Lite20.5%estimated ± 7.9 pp, medium confidence
129Grok 4.1 Fast (Reasoning)20.4%measured
130o320.2%measured
131Ling 3.0 Flash20.1%measured
132Ling 3.0 Flash FP820.1%measured
133K-EXAONE 2.019.7%measured
134Step 3.7 Flash19.5%measured
135Qwen3.5-35B-A3B19.3%measured
136MAI-Thinking-119.2%estimated ± 6.2 pp, medium confidence
137Ornith-1.5-9B19.0%estimated ± 5.1 pp, medium confidence
138Claude 4.1 Opus18.6%measured
139Qwen3.6-35B-A3B18.2%measured
140Claude Sonnet 4.518.1%estimated ± 6.2 pp, medium confidence
141Ternary Bonsai 2 27B18.0%estimated ± 4.2 pp, medium confidence
142Grok 4 Fast (Reasoning)17.9%measured
143Gemini 3 Flash17.9%measured
144Muse Glimmer 30B17.5%measured
145Claude Haiku 4.517.2%estimated ± 7.9 pp, medium confidence
146GLM-4.517.2%estimated ± 7.9 pp, medium confidence
147Laguna XS.216.8%estimated ± 7.9 pp, medium confidence
148Laguna M.116.8%estimated ± 7.9 pp, low confidence
149Gemma 4 26B A4B16.7%measured
150Claude 4 Sonnet16.6%measured
151Gemini 2.5 Pro16.1%measured
152MiMo-V2-Flash16.1%measured
153DeepSeek V3.216.0%measured
154Qwen3 Max15.6%measured
155Qwen3.5-122B-A10B15.6%measured
156o115.2%measured
157Mellum2-12B-A2.5B-Thinking15.2%estimated ± 4.2 pp, medium confidence
158GLM-4.614.9%measured
159Granite 4.2 30B14.8%measured
160Gemma 4 31B14.7%measured
161K-Exaone14.4%measured
162Mistral Medium 3.5 128B14.2%measured
163Gemma 4 12B14.2%measured
164Grok Code Fast 114.1%measured
165Ling 2.6 Flash14.1%measured
166DeepSeek V3.113.7%measured
167DeepSeek V3.1 (Reasoning)13.5%measured
168DeepSeek-R113.1%measured
169Nemotron 3.5 Lightning 30B A3B NVFP412.9%measured
170Nemotron 3 Super 100B12.8%measured
171Kimi K212.7%measured
172GPT-4.112.7%measured
173o3-mini12.5%measured
174MiniCPM5-2B12.5%measured
175o1-pro12.4%measured
176Mercury 2.512.3%measured
177GPT-OSS 120B11.6%measured
178o1-preview11.4%measured
179Grok 4.1 Fast11.3%measured
180Mistral Small 411.3%measured
181Mistral Small 4 (Reasoning)11.3%measured
182ZAYA1-8B11.2%estimated ± 6.2 pp, medium confidence
183GLM-4.5-Air11.1%measured
184Granite 4.2 8B11.1%measured
185Ling 3.0 Tiny11.1%measured
186Trinity-Large-Preview10.8%measured
187Trinity-Large-Thinking10.8%measured
188Claude 3.5 Sonnet10.4%estimated ± 6.2 pp, medium confidence
189ZAYA1-74B-Preview10.3%estimated ± 6.2 pp, medium confidence
190Soofi S 30B-A3B10.3%estimated ± 6.2 pp, medium confidence
191LFM2.5-230M10.3%estimated ± 6.2 pp, low confidence
192LFM2.5-VL-450M10.3%estimated ± 6.2 pp, low confidence
193Nemotron 3 Nano Omni 30B A3B10.3%measured
194GPT-4.1 mini10.2%measured
195LongCat-Flash-Lite-Sparse10.0%estimated ± 1.3 pp, medium confidence
196Llama 4 Maverick10.0%measured
197North Mini Code9.9%measured
198Gemini 2.5 Flash9.9%measured
199DeepSeek V3 03249.7%measured
200MiniCPM5-1B9.6%estimated ± 3.9 pp, low confidence
201Mistral Large 39.3%measured
202Granite 4.2 3B9.1%measured
203Mistral Medium 39.0%measured
204GPT-OSS 20B9.0%measured
205Gemma 4 E4B8.9%measured
206Nemotron 3 Nano 30B8.9%measured
207Mellum2-12B-A2.5B-Instruct8.9%estimated ± 4.2 pp, low confidence
208Sarvam 105B8.8%measured
209Claude 3 Opus8.7%measured
210DeepSeek V38.5%measured
211GPT-4o8.4%measured
212LFM2.5-2.6B8.4%measured
213DeepSeek R1 Distill Qwen 32B8.4%measured
214Llama 4 Scout8.1%measured
215Gemini 1.5 Pro7.9%measured
216GPT-4.1 nano7.8%measured
217Solar Pro 37.8%measured
218Gemma 4 E2B7.8%measured
219Qwen3-Omni-30B-A3B-Thinking7.8%measured
220Ultravox v0.6 Llama 3.3 70B7.7%measured
221Mistral Large 27.6%measured
222Nemotron Ultra 253B7.5%measured
223Llama 3.1 405B7.3%measured
224LFM2.5-8B-A1B7.2%measured
225GPT-4 Turbo7.0%measured
226Solar Pro 27.0%measured
227Nova Pro7.0%measured
228Qwen2.5 Coder 32B Instruct6.7%measured
229GPT-4o mini6.7%measured
230Sarvam 30B6.6%measured
231Celeris-16.4%measured
232Exaone 4.0 32B6.3%measured
233Qwen3-Omni-30B-A3B-Instruct6.0%measured
234Phi-45.9%measured
235Phi-4 Multimodal Instruct5.8%measured
236Claude 3 Haiku5.6%measured
237Gemini 1.0 Pro5.3%measured
238Exaone 4.0 1.2B5.2%measured
239Granite-4.0-H-1B5.2%measured
240Gemma 3 27B4.9%measured
241Granite-4.0-350M4.8%measured
242Granite-4.0-H-350M4.8%measured
243LFM2.5-VL-1.6B-Extract4.8%measured
244LLaDA2.2-mini0.6%estimated ± 7.4 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General