benchgap
Knowledge & reasoning

AA-GPQA Diamond leaderboard

As of 2026-10-07, the highest measured score on AA-GPQA Diamond is 96.1% by GPT-6 Astra. 63 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Gemini 4 Argon96.6%estimated ± 1.2 pp, low confidence
2Claude Sonnet 5.596.2%estimated ± 2.1 pp, low confidence
3Claude Opus 5.596.2%estimated ± 2.1 pp, low confidence
4Ling 3.1 Flash96.2%estimated ± 2.1 pp, low confidence
5GPT-6 Astra96.1%measured
6Gemini 3.8 Flash95.3%measured
7Grok 4.694.9%measured
8Gemini 3.7 Flash94.5%measured
9GPT-6.1 Sol94.4%estimated ± 1.2 pp, high confidence
10GPT-6 Sol94.3%estimated ± 1.2 pp, high confidence
11Gemini 3.1 Pro94.1%measured
12GPT-5.6 Sol94.1%measured
13Claude Fable 5.193.7%measured
14Claude Mythos 593.6%estimated ± 2.7 pp, high confidence
15GPT-5.5 Pro93.5%estimated ± 2.7 pp, high confidence
16GPT-5.593.5%measured
17Kimi K393.5%measured
18Muse Spark 1.393.5%measured
19GPT-5.4 Pro93.4%estimated ± 2.7 pp, high confidence
20dots3-note Preview93.2%estimated ± 2.7 pp, high confidence
21Claude Opus 593.2%measured
22Grok 4.593.1%measured
23MiniMax M392.9%measured
24DeepSeek V4 Pro 081392.8%measured
25Gemini 3.6 Flash92.8%measured
26Qwen3.8 Max Preview92.8%measured
27Claude Fable 592.6%measured
28GPT-5.6 Terra92.5%measured
29Qwen3.7 Max92.3%measured
30Qwen3.8-Flash-Next92.3%measured
31Gemini 3.5 Flash92.2%measured
32Sakana Fugu-Ultra92.2%estimated ± 2.7 pp, high confidence
33Pareto 26.992.0%estimated ± 2.7 pp, high confidence
34Claude Opus 4.892.0%measured
35GPT-5.492.0%measured
36Pareto 26.10 Preview92.0%estimated ± 5.6 pp, medium confidence
37MiMo-V2.6-Pro91.8%estimated ± 6.8 pp, medium confidence
38GLM-5.391.7%measured
39Sakana Fugu91.7%estimated ± 2.7 pp, high confidence
40GPT-5.3 Codex91.5%measured
41Grok 4.791.5%estimated ± 2.1 pp, medium confidence
42Claude Haiku 5.591.4%estimated ± 2.7 pp, high confidence
43Claude Opus 4.7 (Adaptive)91.4%measured
44GLM-5.3-Flash91.2%measured
45Ornith-1.5-397B91.2%estimated ± 2.7 pp, high confidence
46Claude Sonnet 591.1%measured
47GPT-5.6 Luna91.1%measured
48Kimi K2.691.1%measured
49Qwen3.8 Max91.0%estimated ± 2.7 pp, high confidence
50Hy4 preview90.9%estimated ± 2.7 pp, high confidence
51DeepSeek V4 Flash 073190.8%measured
52Gemini 3 Pro90.8%measured
53Mistral Large 490.8%estimated ± 6.8 pp, medium confidence
54MiMo-V2.6-Flash90.7%estimated ± 6.8 pp, medium confidence
55Qwen3.8-27B90.5%measured
56Muse Spark 1.290.4%measured
57GPT-5.290.3%measured
58Grok 4.390.1%measured
59Qwen3.7 Plus90.0%measured
60GPT-5.2-Codex89.9%measured
61Muse Spark 1.189.8%measured
62Hy389.7%measured
63Hy3 Preview89.7%measured
64Claude Opus 4.6 (Adaptive)89.6%measured
65Kimi K2.7 Code89.6%measured
66GLM-5.289.5%measured
67Inkling-Small89.5%measured
68Agents-A189.3%estimated ± 3.4 pp, high confidence
69Step 5 Preview89.3%estimated ± 3.4 pp, high confidence
70Beam89.3%estimated ± 2.7 pp, high confidence
71GPT-6 Luna89.3%estimated ± 1.2 pp, medium confidence
72Solar Pro 489.1%measured
73Gemini 3 Pro Deep Think89.1%estimated ± 2.7 pp, high confidence
74Qwen 3.6 Max (preview)88.8%measured
75Grok 4.2088.7%estimated ± 1.2 pp, medium confidence
76DeepSeek V4.1 Flash88.7%estimated ± 3.4 pp, high confidence
77Qwen3.8-Omni-Flash88.7%estimated ± 3.4 pp, high confidence
78Claude Opus 4.788.5%measured
79Interfaze Beta88.5%estimated ± 5.4 pp, medium confidence
80Muse Spark88.4%measured
81Qwen3.6 Plus88.2%measured
82Kimi K2.587.9%measured
83Kimi K2.5 (Reasoning)87.9%measured
84Grok 487.7%measured
85GPT-5.4 mini87.5%measured
86MiniMax M2.787.4%measured
87GPT-5.187.3%measured
88Inkling87.2%measured
89Solar Open 287.2%estimated ± 2.7 pp, high confidence
90MiMo-V2-Pro87.0%measured
91GLM-5.186.8%measured
92Nemotron 3 Ultra86.7%measured
93Claude Opus 4.5 Thinking86.6%measured
94MiMo-V2.5-Pro86.6%measured
95Apodex 1.186.4%measured
96Apodex 1.1 Mini86.4%measured
97Ling 3.0 Flash VL86.2%measured
98Qwen3.5 397B86.1%measured
99Qwen3.5 397B (Reasoning)86.1%measured
100Seed 2.1 Pro86.1%estimated ± 5.0 pp, medium confidence
101Ornith-1.5-35B-A3B86.1%estimated ± 2.7 pp, high confidence
102GPT-5.1-Codex86.0%measured
103GPT-5.1-Codex-Max86.0%measured
104GLM-4.785.9%measured
105Qwen3.5-27B85.8%measured
106A.X K285.7%measured
107Gemma 4 31B85.7%measured
108Qwen3.5-122B-A10B85.7%measured
109Seed 2.1 Turbo85.6%estimated ± 5.0 pp, medium confidence
110Ling 3.0 Flash85.5%measured
111Ling 3.0 Flash FP885.5%measured
112Claude Sonnet 4.5 Thinking85.5%estimated ± 2.7 pp, high confidence
113Claude Sonnet 4.585.5%estimated ± 2.7 pp, high confidence
114GPT-5 (high)85.4%measured
115Grok 4.1 Fast (Reasoning)85.3%measured
116GLM-5-Turbo84.7%measured
117Grok 4 Fast (Reasoning)84.7%measured
118o3-pro84.5%measured
119Qwen3.5-35B-A3B84.5%measured
120Gemini 2.5 Pro84.4%measured
121Ternary Bonsai 2 27B84.3%estimated ± 5.4 pp, medium confidence
122GPT-5 (medium)84.2%measured
123Qwen3.6-27B84.2%measured
124Qwen3.6-35B-A3B84.1%measured
125Qwen3.5 Flash84.1%estimated ± 4.2 pp, high confidence
126Claude Opus 4.684.0%measured
127Ornith-1.5-9B83.9%estimated ± 2.7 pp, high confidence
128Gemini 3.5 Flash-Lite83.8%measured
129Muse Glimmer 30B83.5%measured
130LongCat-Flash-Lite-Sparse83.0%estimated ± 2.0 pp, low confidence
131K-EXAONE 2.082.9%measured
132Qwen3 235B 250782.8%estimated ± 5.0 pp, medium confidence
133MiMo-V2-Omni82.8%measured
134MAI-Thinking-182.7%estimated ± 5.4 pp, medium confidence
135o382.7%measured
136MiMo-V2.582.5%estimated ± 4.2 pp, high confidence
137Claude 4.1 Opus82.4%estimated ± 6.8 pp, medium confidence
138GLM-582.0%measured
139Gemini 3.1 Flash-Lite81.9%estimated ± 4.2 pp, high confidence
140GPT-5.4 nano81.7%measured
141DeepSeek-R181.3%measured
142Gemini 3 Flash81.2%measured
143Claude Opus 4.581.0%measured
144Claude 4.1 Opus Thinking80.9%measured
145GLM-5V-Turbo80.9%measured
146Step 3.7 Flash80.9%measured
147Nemotron 3 Super 100B80.0%measured
148Claude Sonnet 4.679.9%measured
149Gemma 4 26B A4B79.2%measured
150K-Exaone78.3%measured
151GPT-OSS 120B78.2%measured
152Mercury 2.578.0%estimated ± 5.6 pp, medium confidence
153DeepSeek V3.1 (Reasoning)77.9%measured
154o1-pro77.5%estimated ± 5.4 pp, medium confidence
155Mistral Small 476.9%measured
156Mistral Small 4 (Reasoning)76.9%measured
157Kimi K276.6%measured
158o1-preview76.5%measured
159Qwen3 Max76.4%measured
160Command A+76.1%measured
161Nemotron 3 Nano 30B75.7%measured
162North Mini Code75.7%measured
163Gemma 4 12B75.3%measured
164Trinity-Large-Preview75.2%measured
165Trinity-Large-Thinking75.2%measured
166DeepSeek V3.275.1%measured
167Mistral Medium 3.5 128B74.8%measured
168o3-mini74.8%measured
169o174.7%measured
170Nemotron 3.5 Lightning 30B A3B NVFP474.3%measured
171Sarvam 105B73.8%measured
172DeepSeek V3.173.5%measured
173Ling 3.0 Tiny73.4%measured
174GLM-4.5-Air73.3%measured
175Quasar 438B73.2%measured
176Nemotron Ultra 253B72.8%measured
177Grok Code Fast 172.7%measured
178Qwen3-Omni-30B-A3B-Thinking72.6%measured
179Claude Haiku 4.572.5%estimated ± 4.2 pp, high confidence
180GLM-4.572.5%estimated ± 4.2 pp, high confidence
181Solar Pro 372.4%measured
182MiniCPM5-2B70.2%measured
183MiniCPM5-1B70.2%estimated ± 5.0 pp, low confidence
184ZAYA1-8B69.4%estimated ± 5.4 pp, medium confidence
185Laguna XS.268.9%estimated ± 4.2 pp, high confidence
186GPT-OSS 20B68.8%measured
187Laguna M.168.7%estimated ± 4.2 pp, medium confidence
188Claude 4 Sonnet68.3%measured
189Gemini 2.5 Flash68.3%measured
190Mistral Large 368.0%measured
191Llama 4 Maverick67.1%measured
192GPT-4.166.6%measured
193GPT-4.1 mini66.4%measured
194MiMo-V2-Flash65.6%measured
195DeepSeek V3 032465.5%measured
196Granite 4.2 30B64.4%measured
197Grok 4.1 Fast63.7%measured
198Sarvam 30B63.3%measured
199GLM-4.663.2%measured
200Celeris-163.1%measured
201Granite 4.2 8B63.1%measured
202Exaone 4.0 32B62.8%measured
203Qwen3-Omni-30B-A3B-Instruct62.0%measured
204DeepSeek R1 Distill Qwen 32B61.5%measured
205Ling 2.6 Flash59.3%measured
206Gemini 1.5 Pro58.9%measured
207Llama 4 Scout58.7%measured
208Mistral Medium 357.8%measured
209Claude 3.5 Sonnet57.7%estimated ± 5.4 pp, medium confidence
210Gemma 4 E4B57.6%measured
211Phi-457.5%measured
212Solar Pro 256.1%measured
213Granite 4.2 3B55.9%measured
214Mellum2-12B-A2.5B-Thinking55.9%estimated ± 5.4 pp, medium confidence
215LFM2.5-2.6B55.8%measured
216DeepSeek V355.7%measured
217ZAYA1-74B-Preview55.6%estimated ± 5.4 pp, medium confidence
218GPT-4o54.3%measured
219GPT-4 Turbo52.4%estimated ± 6.8 pp, medium confidence
220Llama 3.1 405B51.5%measured
221LFM2.5-8B-A1B51.3%measured
222GPT-4.1 nano51.2%measured
223Nova Pro49.9%measured
224Ultravox v0.6 Llama 3.3 70B49.8%measured
225Claude 3 Opus48.9%measured
226Mistral Large 248.6%measured
227Nemotron 3 Nano Omni 30B A3B46.9%measured
228Gemma 4 E2B43.3%measured
229Gemma 3 27B42.8%measured
230GPT-4o mini42.6%measured
231Exaone 4.0 1.2B42.4%measured
232LLaDA2.2-mini41.8%estimated ± 5.6 pp, low confidence
233Qwen2.5 Coder 32B Instruct41.7%measured
234Soofi S 30B-A3B41.6%estimated ± 5.4 pp, medium confidence
235Mellum2-12B-A2.5B-Instruct39.1%estimated ± 5.4 pp, low confidence
236Claude 3 Haiku37.4%measured
237Phi-4 Multimodal Instruct31.5%measured
238LFM2.5-VL-1.6B-Extract28.9%measured
239Gemini 1.0 Pro27.7%measured
240Granite-4.0-H-1B26.3%measured
241Granite-4.0-350M26.1%measured
242Granite-4.0-H-350M25.7%measured
243LFM2.5-VL-450M23.7%estimated ± 5.4 pp, low confidence
244LFM2.5-230M23.4%estimated ± 5.4 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General