benchgap
Knowledge & reasoning

AA-HLE leaderboard

As of 2026-10-07, the highest measured score on AA-HLE is 61.4% by Claude Opus 5.5. 47 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Opus 5.561.4%measured
2Claude Fable 5.159.1%measured
3Gemini 4 Argon57.1%measured
4Claude Fable 555.5%measured
5Claude Mythos 555.2%estimated ± 5.0 pp, high confidence
6Claude Sonnet 5.555.0%measured
7Claude Opus 554.9%measured
8GPT-6 Astra54.7%measured
9GPT-6.1 Sol52.9%measured
10Sakana Fugu52.9%estimated ± 4.0 pp, high confidence
11Sakana Fugu-Ultra52.9%estimated ± 4.0 pp, high confidence
12GPT-5.5 Pro51.3%estimated ± 4.6 pp, high confidence
13GPT-5.4 Pro51.0%estimated ± 4.6 pp, high confidence
14GPT-5.6 Sol49.5%measured
15MiMo-V2.6-Pro49.4%measured
16Gemini 3 Pro Deep Think48.8%estimated ± 4.6 pp, high confidence
17Claude Opus 4.848.7%measured
18Muse Spark 1.348.7%measured
19Gemini 3.7 Flash47.9%measured
20GPT-6 Sol47.9%measured
21Gemini 3.8 Flash47.8%measured
22dots3-note Preview47.3%estimated ± 6.3 pp, medium confidence
23Pareto 26.947.1%estimated ± 5.0 pp, high confidence
24Gemini 3.1 Pro47.0%measured
25Kimi K346.9%measured
26Step 5 Preview46.5%measured
27Muse Spark 1.146.2%measured
28GPT-5.545.8%measured
29Muse Spark 1.245.5%measured
30Claude Haiku 5.544.4%measured
31GPT-5.443.7%measured
32Grok 4.743.1%measured
33Qwen3.8 Max Preview43.1%measured
34Ornith-1.5-397B43.1%estimated ± 4.0 pp, high confidence
35GPT-5.6 Terra42.9%measured
36Grok 4.642.9%measured
37Gemini 3.5 Flash42.7%measured
38Grok 4.542.7%measured
39GPT-5.3 Codex42.5%measured
40Qwen3.8 Max42.5%estimated ± 4.0 pp, high confidence
41Claude Opus 4.7 (Adaptive)42.3%measured
42GLM-5.342.3%measured
43Pareto 26.10 Preview41.8%estimated ± 4.0 pp, high confidence
44Hy4 preview41.5%estimated ± 4.0 pp, high confidence
45Claude Sonnet 541.3%measured
46GLM-5.241.1%measured
47DeepSeek V4 Pro 081341.0%measured
48Gemini 3.6 Flash40.8%measured
49Muse Spark40.7%measured
50Grok 4.2040.7%estimated ± 2.6 pp, medium confidence
51Qwen3.7 Max40.5%measured
52Claude Opus 4.6 (Adaptive)39.9%measured
53GLM-5.3-Flash39.9%measured
54Gemini 3 Pro39.7%measured
55GPT-5.6 Luna39.5%measured
56Ling 3.1 Flash39.4%measured
57DeepSeek V4.1 Flash39.2%measured
58MiniMax M339.0%measured
59DeepSeek V4 Flash 073138.6%measured
60GPT-6 Luna38.5%measured
61Qwen3.8-Flash-Next38.0%measured
62Qwen3.8-Omni-Flash37.9%estimated ± 4.0 pp, high confidence
63GPT-5.237.7%measured
64Agents-A137.7%estimated ± 8.4 pp, medium confidence
65Kimi K2.637.5%measured
66Grok 4.337.2%measured
67Beam36.6%estimated ± 4.0 pp, high confidence
68GPT-5.2-Codex35.7%measured
69MiMo-V2.5-Pro35.7%measured
70Qwen3.7 Plus35.6%measured
71Interfaze Beta35.1%estimated ± 4.0 pp, high confidence
72MiMo-V2.6-Flash35.1%measured
73Kimi K2.7 Code35.0%measured
74Mistral Large 435.0%measured
75Apodex 1.134.1%measured
76Apodex 1.1 Mini34.1%measured
77Qwen3.8-27B33.9%measured
78Ornith-1.5-35B-A3B33.5%estimated ± 4.0 pp, high confidence
79Hy333.5%measured
80Hy3 Preview33.5%measured
81Claude Opus 4.733.3%measured
82Inkling-Small33.3%measured
83Inkling31.9%measured
84Claude Sonnet 4.530.9%estimated ± 6.3 pp, medium confidence
85Qwen 3.6 Max (preview)30.8%measured
86Kimi K2.530.7%measured
87Kimi K2.5 (Reasoning)30.7%measured
88MiMo-V2-Pro30.4%measured
89Claude Opus 4.5 Thinking30.1%measured
90GLM-5.130.1%measured
91Claude Sonnet 4.5 Thinking29.7%estimated ± 6.2 pp, medium confidence
92A.X K229.6%measured
93MiniMax M2.729.6%measured
94GLM-529.3%measured
95Solar Pro 429.2%measured
96GPT-5.128.5%measured
97GPT-5 (high)28.5%measured
98Nemotron 3 Ultra28.4%measured
99GPT-5.4 nano28.3%measured
100GPT-5.4 mini28.1%measured
101Ornith-1.5-9B27.9%estimated ± 4.0 pp, high confidence
102GLM-5-Turbo27.8%measured
103Qwen3.6 Plus27.8%measured
104Solar Open 227.7%estimated ± 4.0 pp, high confidence
105GLM-4.727.4%measured
106Ternary Bonsai 2 27B26.8%estimated ± 4.0 pp, high confidence
107Grok 426.7%measured
108GPT-5.1-Codex25.7%measured
109GPT-5.1-Codex-Max25.7%measured
110Qwen3.5 Flash25.7%estimated ± 7.4 pp, medium confidence
111GPT-5 (medium)25.4%measured
112Qwen3.5-122B-A10B25.2%measured
113MAI-Thinking-124.3%estimated ± 4.0 pp, high confidence
114MiMo-V2.524.0%estimated ± 7.4 pp, medium confidence
115Qwen3.5-27B23.9%measured
116o3-pro23.8%estimated ± 4.0 pp, high confidence
117Ling 3.0 Flash23.7%measured
118Ling 3.0 Flash FP823.7%measured
119Gemma 4 31B23.6%measured
120Gemini 3.1 Flash-Lite23.4%estimated ± 7.4 pp, medium confidence
121Qwen3.6-27B23.1%measured
122Gemini 2.5 Pro22.5%measured
123Qwen3.6-35B-A3B22.2%measured
124MiMo-V2-Omni22.1%measured
125Ling 3.0 Flash VL22.0%measured
126Muse Glimmer 30B22.0%measured
127Step 3.7 Flash21.4%measured
128Qwen3.5-35B-A3B21.0%measured
129Nemotron 3 Super 100B20.8%measured
130o320.1%measured
131Qwen3.5 397B19.8%measured
132Qwen3.5 397B (Reasoning)19.8%measured
133GPT-OSS 120B19.6%measured
134Gemma 4 26B A4B19.3%measured
135Grok 4.1 Fast (Reasoning)19.3%measured
136Claude Opus 4.619.1%measured
137Grok 4 Fast (Reasoning)19.1%measured
138Gemini 3.5 Flash-Lite18.8%measured
139Claude 4.1 Opus18.7%estimated ± 4.4 pp, high confidence
140Quasar 438B18.7%measured
141K-EXAONE 2.018.6%measured
142GLM-5V-Turbo17.1%measured
143DeepSeek-R115.8%measured
144Trinity-Large-Preview15.8%measured
145Trinity-Large-Thinking15.8%measured
146Gemma 4 12B15.7%measured
147Claude Haiku 4.515.6%estimated ± 7.4 pp, medium confidence
148GLM-4.515.6%estimated ± 7.4 pp, medium confidence
149Gemini 3 Flash15.0%measured
150DeepSeek V3.1 (Reasoning)14.3%measured
151Qwen3 235B 250714.3%estimated ± 6.5 pp, medium confidence
152K-Exaone13.9%measured
153Mistral Medium 3.5 128B13.8%measured
154Claude Sonnet 4.613.3%measured
155Claude Opus 4.513.2%measured
156Claude 4.1 Opus Thinking12.5%measured
157o1-preview12.2%estimated ± 4.0 pp, high confidence
158Command A+12.0%measured
159Qwen3 Max11.9%measured
160Mercury 2.511.8%measured
161Nemotron 3 Nano 30B11.4%measured
162Laguna XS.211.4%estimated ± 7.4 pp, medium confidence
163DeepSeek V3.211.2%measured
164Granite 4.2 30B11.2%measured
165North Mini Code11.1%measured
166GPT-OSS 20B11.0%measured
167Sarvam 105B11.0%measured
168Laguna M.110.7%estimated ± 7.4 pp, low confidence
169Nemotron 3.5 Lightning 30B A3B NVFP410.6%measured
170ZAYA1-8B10.5%estimated ± 4.0 pp, high confidence
171Solar Pro 310.3%measured
172o1-pro10.2%estimated ± 4.4 pp, high confidence
173Mistral Small 49.9%measured
174Mistral Small 4 (Reasoning)9.9%measured
175Granite 4.2 8B9.7%measured
176LongCat-Flash-Lite-Sparse9.5%estimated ± 4.0 pp, high confidence
177Ling 3.0 Tiny9.3%measured
178MiniCPM5-2B8.9%measured
179MiMo-V2-Flash8.6%measured
180Grok Code Fast 18.0%measured
181o3-mini7.9%measured
182Qwen3-Omni-30B-A3B-Thinking7.5%measured
183Sarvam 30B7.5%measured
184Kimi K27.4%measured
185Nemotron Ultra 253B7.4%measured
186GLM-4.5-Air7.0%measured
187o17.0%measured
188LFM2.5-8B-A1B6.9%measured
189Celeris-16.8%measured
190DeepSeek V3.16.7%measured
191Granite 4.2 3B6.6%measured
192Granite-4.0-H-350M6.4%measured
193Ling 2.6 Flash6.3%measured
194LFM2.5-2.6B6.2%measured
195Exaone 4.0 1.2B5.7%measured
196GLM-4.65.5%measured
197Granite-4.0-350M5.5%measured
198Grok 4.1 Fast5.1%measured
199LFM2.5-VL-1.6B-Extract5.1%measured
200Exaone 4.0 32B5.0%measured
201GPT-4.1 mini5.0%measured
202Granite-4.0-H-1B5.0%measured
203Phi-4 Multimodal Instruct5.0%measured
204Claude 3.5 Sonnet4.9%estimated ± 6.5 pp, medium confidence
205Llama 4 Maverick4.9%measured
206Gemma 4 E2B4.8%measured
207Nemotron 3 Nano Omni 30B A3B4.8%measured
208DeepSeek V3 03244.7%measured
209Gemini 2.5 Flash4.7%measured
210DeepSeek R1 Distill Qwen 32B4.6%measured
211Gemini 1.5 Pro4.6%measured
212Qwen3-Omni-30B-A3B-Instruct4.6%measured
213Gemma 3 27B4.4%measured
214Claude 4 Sonnet4.3%measured
215Gemini 1.0 Pro4.2%measured
216GPT-4.14.2%measured
217GPT-4o mini4.2%measured
218Mistral Large 34.2%measured
219Claude 3 Haiku4.1%measured
220Mistral Medium 34.1%measured
221Llama 3.1 405B4.0%measured
222Gemma 4 E4B3.8%measured
223GPT-4.1 nano3.8%measured
224Llama 4 Scout3.8%measured
225Phi-43.8%measured
226Solar Pro 23.7%measured
227Ultravox v0.6 Llama 3.3 70B3.6%measured
228Qwen2.5 Coder 32B Instruct3.5%measured
229Mistral Large 23.3%measured
230Mellum2-12B-A2.5B-Thinking3.3%estimated ± 4.0 pp, medium confidence
231Nova Pro3.2%measured
232ZAYA1-74B-Preview3.2%estimated ± 4.0 pp, medium confidence
233GPT-4 Turbo3.1%measured
234DeepSeek V32.9%measured
235Claude 3 Opus2.8%measured
236GPT-4o2.4%measured
237LFM2.5-230M0.0%estimated ± 4.0 pp, medium confidence
238LFM2.5-VL-450M0.0%estimated ± 6.5 pp, low confidence
239LLaDA2.2-mini0.0%estimated ± 4.0 pp, medium confidence
240Mellum2-12B-A2.5B-Instruct0.0%estimated ± 4.0 pp, medium confidence
241MiniCPM5-1B0.0%estimated ± 4.0 pp, medium confidence
242Soofi S 30B-A3B0.0%estimated ± 4.0 pp, medium confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General