benchgap
Knowledge & reasoning

CritPt leaderboard

As of 2026-10-07, the highest measured score on CritPt is 32.3% by GPT-5.6 Sol. 52 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1GPT-5.6 Sol32.3%measured
2Claude Opus 5.531.7%measured
3GPT-6.1 Sol31.7%measured
4GPT-6 Astra31.7%measured
5Claude Sonnet 5.531.4%measured
6GPT-6 Sol30.9%measured
7GPT-5.5 Pro30.6%measured
8Sakana Fugu30.3%estimated ± 4.1 pp, high confidence
9Sakana Fugu-Ultra30.3%estimated ± 4.1 pp, high confidence
10GPT-5.4 Pro30.0%measured
11GPT-5.6 Terra30.0%measured
12Claude Fable 5.129.7%measured
13Claude Opus 529.1%measured
14Claude Fable 528.6%measured
15Gemini 4 Argon27.1%measured
16GPT-5.527.1%measured
17MiMo-V2.6-Pro26.6%measured
18Gemini 3 Pro Deep Think25.7%measured
19Muse Spark 1.324.9%measured
20Claude Mythos 524.6%estimated ± 4.1 pp, high confidence
21GPT-5.423.4%measured
22Kimi K323.4%measured
23dots3-note Preview23.0%estimated ± 5.7 pp, medium confidence
24Pareto 26.921.6%estimated ± 6.2 pp, medium confidence
25Claude Opus 4.820.9%measured
26GLM-5.220.9%measured
27Step 5 Preview20.9%measured
28GPT-5.6 Luna20.6%measured
29GPT-6 Luna19.4%measured
30GLM-5.319.1%measured
31Claude Haiku 5.518.9%measured
32Ornith-1.5-397B18.8%estimated ± 4.1 pp, high confidence
33Gemini 3.8 Flash18.3%measured
34DeepSeek V4 Pro 081318.0%measured
35Ling 3.1 Flash18.0%measured
36Qwen3.8 Max18.0%estimated ± 4.1 pp, high confidence
37Gemini 3.1 Pro17.7%measured
38Grok 4.717.7%measured
39Muse Spark 1.217.7%measured
40Qwen3.8 Max Preview17.7%measured
41Pareto 26.10 Preview17.5%estimated ± 4.9 pp, high confidence
42Grok 4.617.1%measured
43Claude Sonnet 516.9%measured
44GPT-5.3 Codex16.9%measured
45Hy4 preview16.9%measured
46DeepSeek V4 Flash 073116.6%measured
47GLM-5.3-Flash15.4%measured
48Grok 4.515.4%measured
49Muse Spark 1.115.1%measured
50DeepSeek V4.1 Flash14.3%measured
51Gemini 3.7 Flash14.3%measured
52Qwen3.7 Max13.4%measured
53Gemini 3.5 Flash13.1%measured
54Claude Opus 4.6 (Adaptive)12.6%measured
55Beam12.2%estimated ± 4.9 pp, high confidence
56Claude Opus 4.7 (Adaptive)12.0%measured
57MiMo-V2.6-Flash12.0%measured
58Agents-A112.0%estimated ± 6.5 pp, medium confidence
59Qwen3.8-Omni-Flash11.6%estimated ± 4.1 pp, high confidence
60GPT-5.211.6%measured
61Muse Spark11.3%measured
62Qwen3.8-Flash-Next11.1%measured
63Gemini 3.6 Flash10.6%measured
64Mistral Large 410.6%measured
65GPT-5.4 mini10.0%measured
66Kimi K2.7 Code10.0%measured
67Claude Sonnet 4.5 Thinking9.8%estimated ± 5.7 pp, medium confidence
68Quasar 438B9.4%measured
69GPT-5.4 nano9.3%measured
70Gemini 3 Pro9.1%measured
71Qwen3.7 Plus9.1%measured
72A.X K28.9%measured
73GPT-5.2-Codex8.7%measured
74Inkling-Small8.3%measured
75Interfaze Beta8.2%estimated ± 4.1 pp, high confidence
76Grok 4.38.0%measured
77Kimi K2.68.0%measured
78Grok 4.207.8%estimated ± 4.9 pp, high confidence
79Ornith-1.5-35B-A3B6.5%estimated ± 4.1 pp, high confidence
80GPT-5.1-Codex5.7%measured
81GPT-5.1-Codex-Max5.7%measured
82GPT-5 (high)5.7%measured
83Inkling5.4%measured
84Qwen3.8-27B5.4%measured
85Solar Pro 45.4%measured
86Claude Opus 4.75.1%measured
87GPT-5.14.9%measured
88Hy34.9%measured
89Hy3 Preview4.9%measured
90Apodex 1.14.6%measured
91Apodex 1.1 Mini4.6%measured
92Claude Opus 4.5 Thinking4.6%measured
93GLM-5.14.6%measured
94Qwen3.5 Flash4.0%estimated ± 6.6 pp, medium confidence
95MiMo-V2.5-Pro4.0%measured
96Solar Open 23.8%estimated ± 4.9 pp, high confidence
97MiniMax M33.7%measured
98Qwen 3.6 Max (preview)3.7%measured
99MiMo-V2.53.6%estimated ± 6.6 pp, medium confidence
100Gemini 3.1 Flash-Lite3.4%estimated ± 6.6 pp, medium confidence
101Kimi K2.53.1%measured
102Kimi K2.5 (Reasoning)3.1%measured
103Nemotron 3 Super 100B3.1%measured
104Nemotron 3 Ultra3.1%measured
105Grok 4.1 Fast (Reasoning)2.9%measured
106Grok 4 Fast (Reasoning)2.9%measured
107Qwen3.6 Plus2.9%measured
108Claude Opus 4.62.8%measured
109Claude Haiku 4.52.6%estimated ± 6.6 pp, medium confidence
110GLM-4.52.6%estimated ± 6.6 pp, medium confidence
111Gemini 2.5 Pro2.6%measured
112Muse Glimmer 30B2.6%measured
113Ornith-1.5-9B2.6%estimated ± 4.1 pp, high confidence
114Laguna XS.22.6%estimated ± 6.6 pp, medium confidence
115Laguna M.12.6%estimated ± 6.6 pp, low confidence
116Step 3.7 Flash2.3%measured
117Ternary Bonsai 2 27B2.1%estimated ± 4.1 pp, high confidence
118DeepSeek V3.1 (Reasoning)2.0%measured
119GLM-52.0%measured
120Grok 42.0%measured
121Ling 3.0 Flash VL2.0%measured
122Claude 4.1 Opus1.7%estimated ± 3.7 pp, high confidence
123GLM-4.71.7%measured
124Ling 3.0 Flash1.7%measured
125Ling 3.0 Flash FP81.7%measured
126o3-pro1.6%estimated ± 2.9 pp, high confidence
127DeepSeek-R11.4%measured
128Gemini 2.5 Flash1.4%measured
129Gemini 3 Flash1.4%measured
130Gemma 4 31B1.4%measured
131GPT-OSS 20B1.4%measured
132MAI-Thinking-11.4%estimated ± 4.1 pp, high confidence
133Claude Sonnet 4.51.1%estimated ± 4.1 pp, high confidence
134Claude 4 Sonnet1.1%measured
135GPT-OSS 120B1.1%measured
136K-Exaone1.1%measured
137MiMo-V2-Omni1.1%measured
138o31.1%measured
139Qwen3.6-27B1.1%measured
140Claude Sonnet 4.60.9%measured
141DeepSeek V3.20.9%measured
142K-EXAONE 2.00.9%measured
143Nemotron 3 Nano 30B0.9%measured
144Qwen3.5-27B0.9%measured
145Qwen3.5-35B-A3B0.9%measured
146Qwen3.5 397B0.9%measured
147Qwen3.5 397B (Reasoning)0.9%measured
148Trinity-Large-Preview0.9%measured
149Trinity-Large-Thinking0.9%measured
150Qwen3 235B 25070.6%estimated ± 4.1 pp, high confidence
151Gemma 4 E4B0.6%measured
152GLM-5V-Turbo0.6%measured
153MiniMax M2.70.6%measured
154Qwen3.5-122B-A10B0.6%measured
155o1-preview0.6%estimated ± 2.9 pp, high confidence
156ZAYA1-8B0.6%estimated ± 4.1 pp, high confidence
157Claude 3.5 Sonnet0.6%estimated ± 4.1 pp, high confidence
158LFM2.5-230M0.6%estimated ± 4.1 pp, medium confidence
159LFM2.5-VL-450M0.6%estimated ± 4.1 pp, medium confidence
160Mellum2-12B-A2.5B-Instruct0.6%estimated ± 4.1 pp, medium confidence
161Mellum2-12B-A2.5B-Thinking0.6%estimated ± 4.1 pp, high confidence
162Soofi S 30B-A3B0.6%estimated ± 4.1 pp, high confidence
163ZAYA1-74B-Preview0.6%estimated ± 4.1 pp, high confidence
164o1-pro0.4%estimated ± 3.7 pp, high confidence
165o3-mini0.3%estimated ± 2.3 pp, high confidence
166Claude Opus 4.50.3%measured
167Command A+0.3%measured
168GLM-5-Turbo0.3%measured
169Granite 4.2 30B0.3%measured
170Granite 4.2 8B0.3%measured
171MiMo-V2-Pro0.3%measured
172MiniCPM5-2B0.3%measured
173Mistral Small 40.3%measured
174Mistral Small 4 (Reasoning)0.3%measured
175North Mini Code0.3%measured
176o10.3%measured
177Qwen3.6-35B-A3B0.3%measured
178Sarvam 30B0.3%measured
179Phi-4 Multimodal Instruct0.3%estimated ± 2.3 pp, high confidence
180DeepSeek R1 Distill Qwen 32B0.3%estimated ± 2.3 pp, high confidence
181Gemini 1.5 Pro0.3%estimated ± 2.3 pp, high confidence
182Gemini 1.0 Pro0.3%estimated ± 2.3 pp, high confidence
183GPT-4o mini0.3%estimated ± 2.3 pp, high confidence
184Qwen2.5 Coder 32B Instruct0.3%estimated ± 2.3 pp, high confidence
185GPT-4 Turbo0.3%estimated ± 2.3 pp, high confidence
186Claude 3 Opus0.3%estimated ± 2.3 pp, high confidence
187LongCat-Flash-Lite-Sparse0.1%estimated ± 1.1 pp, low confidence
188Celeris-10.0%measured
189Claude 3 Haiku0.0%measured
190Claude 4.1 Opus Thinking0.0%measured
191DeepSeek V30.0%measured
192DeepSeek V3 03240.0%measured
193DeepSeek V3.10.0%measured
194Exaone 4.0 1.2B0.0%measured
195Exaone 4.0 32B0.0%measured
196Gemini 3.5 Flash-Lite0.0%measured
197Gemma 3 27B0.0%measured
198Gemma 4 12B0.0%measured
199Gemma 4 26B A4B0.0%measured
200Gemma 4 E2B0.0%measured
201GLM-4.5-Air0.0%measured
202GLM-4.60.0%measured
203GPT-4.10.0%measured
204GPT-4.1 mini0.0%measured
205GPT-4.1 nano0.0%measured
206GPT-4o0.0%measured
207GPT-5 (medium)0.0%measured
208Granite-4.0-350M0.0%measured
209Granite-4.0-H-1B0.0%measured
210Granite-4.0-H-350M0.0%measured
211Granite 4.2 3B0.0%measured
212Grok 4.1 Fast0.0%measured
213Grok Code Fast 10.0%measured
214Kimi K20.0%measured
215LFM2.5-2.6B0.0%measured
216LFM2.5-8B-A1B0.0%measured
217LFM2.5-VL-1.6B-Extract0.0%measured
218Ling 2.6 Flash0.0%measured
219Ling 3.0 Tiny0.0%measured
220LLaDA2.2-mini0.0%estimated ± 4.9 pp, medium confidence
221Llama 3.1 405B0.0%measured
222Llama 4 Maverick0.0%measured
223Llama 4 Scout0.0%measured
224Mercury 2.50.0%measured
225MiMo-V2-Flash0.0%measured
226MiniCPM5-1B0.0%estimated ± 4.9 pp, medium confidence
227Mistral Large 20.0%measured
228Mistral Large 30.0%measured
229Mistral Medium 30.0%measured
230Mistral Medium 3.5 128B0.0%measured
231Nemotron 3.5 Lightning 30B A3B NVFP40.0%measured
232Nemotron 3 Nano Omni 30B A3B0.0%measured
233Nemotron Ultra 253B0.0%measured
234Nova Pro0.0%measured
235Phi-40.0%measured
236Qwen3 Max0.0%measured
237Qwen3-Omni-30B-A3B-Instruct0.0%measured
238Qwen3-Omni-30B-A3B-Thinking0.0%measured
239Sarvam 105B0.0%measured
240Solar Pro 20.0%measured
241Solar Pro 30.0%measured
242Ultravox v0.6 Llama 3.3 70B0.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General