benchgap
Knowledge & reasoning

AA-Omniscience Accuracy leaderboard

As of 2026-10-07, the highest measured score on AA-Omniscience Accuracy is 67.2% by Claude Fable 5.1. 61 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Fable 5.167.2%measured
2Claude Opus 5.566.2%measured
3Claude Fable 565.4%measured
4GPT-6 Astra62.6%measured
5GPT-6.1 Sol62.1%measured
6Claude Opus 560.9%measured
7GPT-5.6 Sol59.4%measured
8Sakana Fugu58.1%estimated ± 8.1 pp, medium confidence
9Sakana Fugu-Ultra58.1%estimated ± 8.1 pp, medium confidence
10GPT-5.558.0%measured
11GPT-5.5 Pro56.2%estimated ± 6.2 pp, medium confidence
12GPT-5.4 Pro55.9%estimated ± 6.2 pp, medium confidence
13Gemini 3 Pro55.8%measured
14Gemini 3.7 Flash55.3%measured
15dots3-note Preview55.2%estimated ± 6.2 pp, medium confidence
16Gemini 3.1 Pro54.9%measured
17Gemini 3.8 Flash54.6%measured
18GPT-6 Sol54.5%measured
19Claude Sonnet 5.554.0%measured
20GPT-5.3 Codex52.9%measured
21Muse Spark 1.152.1%measured
22Gemini 3.5 Flash51.9%measured
23Grok 4.551.6%measured
24Claude Mythos 551.2%estimated ± 8.1 pp, medium confidence
25GPT-5.450.8%measured
26Pareto 26.950.3%estimated ± 8.6 pp, medium confidence
27Gemini 3.6 Flash50.0%measured
28Gemini 4 Argon49.9%measured
29Muse Spark49.6%measured
30DeepSeek V4 Pro 081349.1%measured
31Claude Opus 4.7 (Adaptive)48.9%measured
32Claude Opus 4.848.8%measured
33Grok 4.648.2%measured
34Grok 4.2047.6%estimated ± 4.6 pp, medium confidence
35Kimi K347.6%measured
36Grok 4.747.4%measured
37Claude Opus 4.6 (Adaptive)47.0%measured
38GPT-5.6 Terra46.8%measured
39Claude Opus 4.5 Thinking46.6%measured
40DeepSeek V4.1 Flash46.4%measured
41Claude Haiku 5.546.1%estimated ± 6.9 pp, medium confidence
42Qwen3.8 Max46.0%estimated ± 7.7 pp, medium confidence
43Claude Opus 4.645.8%measured
44Gemini 3 Flash45.8%measured
45Muse Spark 1.245.4%measured
46Ornith-1.5-397B45.4%estimated ± 8.1 pp, medium confidence
47Hy4 preview45.0%estimated ± 7.9 pp, medium confidence
48Claude Opus 4.744.7%measured
49GPT-5.244.3%measured
50GPT-6 Luna43.8%measured
51Muse Spark 1.343.6%measured
52Gemini 3 Pro Deep Think43.4%estimated ± 6.2 pp, medium confidence
53Pareto 26.10 Preview42.9%estimated ± 8.6 pp, medium confidence
54GPT-5.6 Luna42.7%measured
55Inkling41.6%measured
56Step 5 Preview41.5%measured
57GLM-5.3-Flash41.3%estimated ± 6.9 pp, medium confidence
58GPT-5.2-Codex41.1%measured
59Claude Opus 4.540.9%measured
60Grok 440.5%measured
61DeepSeek V4 Flash 073140.4%measured
62GPT-5 (high)40.3%measured
63Claude Sonnet 540.1%measured
64GPT-5.1-Codex39.9%measured
65GPT-5.1-Codex-Max39.9%measured
66Agents-A139.9%estimated ± 10.5 pp, low confidence
67Kimi K2.7 Code39.6%measured
68GPT-5 (medium)39.5%measured
69Gemini 2.5 Pro39.1%measured
70Claude Sonnet 4.638.6%measured
71o338.6%measured
72Qwen3.8-Omni-Flash38.3%estimated ± 8.1 pp, medium confidence
73Beam38.2%estimated ± 8.6 pp, medium confidence
74Qwen 3.6 Max (preview)37.9%measured
75GPT-5.137.7%measured
76GPT-5.4 mini37.5%measured
77Kimi K2.535.2%measured
78Kimi K2.5 (Reasoning)35.2%measured
79MiMo-V2.6-Pro34.8%measured
80Interfaze Beta34.7%estimated ± 8.1 pp, medium confidence
81Grok 4.334.6%measured
82o134.5%measured
83GLM-5.333.9%measured
84Gemini 3.1 Flash-Lite33.7%estimated ± 7.7 pp, medium confidence
85Inkling-Small33.2%measured
86Claude Sonnet 4.5 Thinking33.0%estimated ± 6.2 pp, medium confidence
87Claude Sonnet 4.533.0%estimated ± 6.2 pp, medium confidence
88Kimi K2.632.6%measured
89Ornith-1.5-35B-A3B32.6%estimated ± 8.1 pp, medium confidence
90Hy332.0%measured
91Apodex 1.131.7%measured
92Apodex 1.1 Mini31.7%measured
93Qwen3.8 Max Preview31.7%measured
94Hy3 Preview31.5%measured
95Solar Open 231.1%estimated ± 8.6 pp, medium confidence
96Qwen3.7 Max31.1%measured
97DeepSeek-R130.5%measured
98Gemini 3.5 Flash-Lite29.5%measured
99GLM-4.729.3%measured
100GLM-5V-Turbo29.3%measured
101Ling 3.1 Flash29.1%measured
102DeepSeek V3.1 (Reasoning)29.0%measured
103GLM-5-Turbo28.4%measured
104o3-pro27.9%estimated ± 7.5 pp, medium confidence
105Seed 2.1 Pro27.9%estimated ± 6.0 pp, medium confidence
106GPT-4.127.8%measured
107Kimi K227.4%measured
108Qwen3.5 Flash27.0%estimated ± 7.7 pp, medium confidence
109MiMo-V2.6-Flash27.0%measured
110Muse Glimmer 30B27.0%measured
111MiniMax M2.726.8%measured
112MiMo-V2-Pro26.6%measured
113Qwen3.6 Plus26.4%measured
114GLM-526.3%measured
115Ornith-1.5-9B26.1%estimated ± 8.1 pp, medium confidence
116Gemini 2.5 Flash26.1%measured
117Mistral Large 425.8%measured
118Step 3.7 Flash25.8%measured
119GPT-5.4 nano25.7%measured
120Seed 2.1 Turbo25.6%estimated ± 6.0 pp, medium confidence
121DeepSeek V325.5%measured
122Grok 4.1 Fast (Reasoning)25.1%measured
123Mistral Large 325.0%measured
124MiMo-V2.524.9%estimated ± 7.7 pp, medium confidence
125Llama 4 Maverick24.9%measured
126Claude 4.1 Opus24.8%estimated ± 7.5 pp, medium confidence
127Mistral Medium 3.5 128B24.7%measured
128Qwen3.5 397B24.5%measured
129Qwen3.5 397B (Reasoning)24.5%measured
130Qwen3.8-Flash-Next24.5%measured
131Qwen3.5-122B-A10B24.4%measured
132Qwen3 Max24.4%measured
133DeepSeek V3 032424.3%measured
134GLM-5.224.3%measured
135Nemotron 3 Super 100B24.3%measured
136DeepSeek V3.224.0%measured
137GLM-5.123.7%measured
138Grok Code Fast 123.5%measured
139GLM-4.523.2%estimated ± 7.7 pp, medium confidence
140Llama 3.1 405B23.2%measured
141DeepSeek V3.123.1%measured
142Grok 4 Fast (Reasoning)22.8%measured
143MAI-Thinking-122.8%estimated ± 8.1 pp, medium confidence
144Claude 4 Sonnet22.7%measured
145Qwen3.7 Plus22.5%measured
146Trinity-Large-Preview22.5%measured
147Trinity-Large-Thinking22.5%measured
148Qwen3 235B 250722.4%estimated ± 6.0 pp, medium confidence
149MiMo-V2.5-Pro22.4%measured
150Claude Haiku 4.522.2%estimated ± 7.7 pp, medium confidence
151Mercury 2.522.0%measured
152GPT-OSS 120B21.8%measured
153Mistral Small 421.7%measured
154Mistral Small 4 (Reasoning)21.7%measured
155Laguna XS.221.7%estimated ± 7.7 pp, low confidence
156Laguna M.121.7%estimated ± 7.7 pp, low confidence
157Nemotron 3 Ultra21.6%measured
158GLM-4.621.4%measured
159o3-mini20.8%estimated ± 1.8 pp, medium confidence
160Qwen3.5-27B20.7%measured
161GPT-4.1 mini20.3%measured
162Nemotron Ultra 253B20.1%measured
163Qwen3.5-35B-A3B20.1%measured
164Gemma 4 31B20.0%measured
165GPT-4o19.9%measured
166Mistral Large 219.9%measured
167Qwen3.6-27B19.6%measured
168o1-pro19.5%estimated ± 7.5 pp, medium confidence
169MiMo-V2-Omni19.3%measured
170Claude 4.1 Opus Thinking19.3%estimated ± 6.9 pp, medium confidence
171Gemma 4 26B A4B19.1%measured
172Ultravox v0.6 Llama 3.3 70B19.0%measured
173North Mini Code18.9%measured
174Solar Pro 418.9%measured
175Qwen3.6-35B-A3B18.8%measured
176o1-preview18.7%estimated ± 7.5 pp, medium confidence
177A.X K218.6%measured
178Solar Pro 318.5%measured
179LongCat-Flash-Lite-Sparse18.4%estimated ± 1.8 pp, medium confidence
180Mistral Medium 318.3%measured
181Ling 3.0 Flash18.2%measured
182Ling 3.0 Flash FP818.2%measured
183Claude 3 Haiku17.6%measured
184Sarvam 105B17.6%measured
185Phi-4 Multimodal Instruct17.5%estimated ± 6.9 pp, medium confidence
186DeepSeek R1 Distill Qwen 32B17.4%estimated ± 6.9 pp, medium confidence
187Gemini 1.5 Pro17.4%estimated ± 6.9 pp, medium confidence
188Gemini 1.0 Pro17.4%estimated ± 6.9 pp, medium confidence
189GPT-4o mini17.4%estimated ± 6.9 pp, medium confidence
190Qwen2.5 Coder 32B Instruct17.3%estimated ± 6.9 pp, medium confidence
191GPT-4 Turbo17.3%estimated ± 6.9 pp, medium confidence
192Nemotron 3 Nano 30B17.3%measured
193Claude 3 Opus17.3%estimated ± 6.9 pp, medium confidence
194Grok 4.1 Fast17.2%measured
195Nova Pro16.9%measured
196MiniMax M316.7%measured
197ZAYA1-8B16.7%estimated ± 8.1 pp, medium confidence
198K-Exaone16.4%measured
199GLM-4.5-Air16.3%measured
200Claude 3.5 Sonnet16.3%estimated ± 8.1 pp, medium confidence
201ZAYA1-74B-Preview16.3%estimated ± 8.1 pp, medium confidence
202Soofi S 30B-A3B16.2%estimated ± 8.1 pp, medium confidence
203LFM2.5-230M16.2%estimated ± 8.1 pp, low confidence
204LFM2.5-VL-450M16.2%estimated ± 8.1 pp, low confidence
205Solar Pro 216.1%measured
206GPT-OSS 20B16.0%measured
207Gemma 4 12B15.6%measured
208Ling 2.6 Flash15.6%measured
209MiMo-V2-Flash15.6%measured
210Qwen3.8-27B15.6%measured
211Quasar 438B15.5%measured
212Llama 4 Scout15.2%measured
213Nemotron 3 Nano Omni 30B A3B15.2%measured
214Qwen3-Omni-30B-A3B-Thinking14.6%measured
215Ling 3.0 Flash VL14.4%measured
216Nemotron 3.5 Lightning 30B A3B NVFP414.4%measured
217Qwen3-Omni-30B-A3B-Instruct14.3%measured
218Phi-414.1%measured
219GPT-4.1 nano13.7%measured
220K-EXAONE 2.013.1%measured
221Gemma 3 27B13.0%measured
222Sarvam 30B12.6%measured
223Ternary Bonsai 2 27B11.7%estimated ± 4.5 pp, medium confidence
224Granite 4.2 8B11.2%measured
225Celeris-111.0%measured
226Exaone 4.0 32B10.6%measured
227Granite 4.2 30B10.1%measured
228LFM2.5-8B-A1B9.4%measured
229Granite 4.2 3B9.2%measured
230Mellum2-12B-A2.5B-Thinking8.9%estimated ± 4.5 pp, medium confidence
231Command A+8.9%measured
232Gemma 4 E4B8.6%measured
233Ling 3.0 Tiny8.5%measured
234MiniCPM5-2B8.4%measured
235Gemma 4 E2B6.6%measured
236LFM2.5-VL-1.6B-Extract5.8%measured
237Granite-4.0-H-1B5.2%measured
238Mellum2-12B-A2.5B-Instruct5.1%estimated ± 4.5 pp, low confidence
239Exaone 4.0 1.2B5.0%measured
240LFM2.5-2.6B4.4%measured
241LLaDA2.2-mini4.1%estimated ± 8.6 pp, low confidence
242Granite-4.0-350M3.9%measured
243Granite-4.0-H-350M3.8%measured
244MiniCPM5-1B3.3%estimated ± 4.5 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General