benchgap
Long context

AA-LCR leaderboard

As of 2026-10-07, the highest measured score on AA-LCR is 88.7% by Kimi K3. 8 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Kimi K388.7%measured
2Step 5 Preview88.3%measured
3MiMo-V2.6-Pro86.3%measured
4Claude Fable 5.185.3%measured
5Claude Opus 5.584.7%measured
6GPT-5.584.3%measured
7DeepSeek V4.1 Flash84.0%measured
8GPT-5.6 Sol84.0%measured
9GPT-5.6 Luna83.7%measured
10GPT-6 Sol83.7%measured
11GPT-5.3 Codex83.3%measured
12GPT-6 Luna83.3%measured
13Muse Glimmer 30B83.3%measured
14GPT-5.6 Terra83.0%measured
15GPT-6.1 Sol83.0%measured
16Ling 3.1 Flash83.0%measured
17MiniMax M383.0%measured
18Muse Spark 1.383.0%measured
19Claude Haiku 5.582.7%measured
20Claude Sonnet 5.582.7%measured
21GPT-5.282.7%measured
22Claude Fable 582.3%measured
23GPT-5.2-Codex82.3%measured
24Claude Sonnet 582.0%measured
25Gemini 3.1 Pro82.0%measured
26GPT-5.482.0%measured
27Qwen3.8-27B82.0%measured
28Gemini 3.7 Flash81.7%measured
29Gemini 3.8 Flash81.3%measured
30Mistral Large 481.3%measured
31Kimi K2.681.0%measured
32GPT-6 Astra80.7%measured
33Qwen 3.6 Max (preview)80.7%measured
34DeepSeek V4 Pro 081380.3%measured
35Grok 4.680.3%measured
36Qwen3.8 Max Preview80.3%measured
37Gemini 3.6 Flash80.0%measured
38GLM-5.3-Flash80.0%measured
39GPT-5.180.0%measured
40DeepSeek V4 Flash 073179.7%measured
41Gemini 4 Argon79.7%measured
42GLM-5.379.7%measured
43MiMo-V2.5-Pro79.7%measured
44Qwen3.8-Flash-Next79.7%measured
45Apodex 1.179.3%measured
46Apodex 1.1 Mini79.3%measured
47Claude Opus 579.3%measured
48Grok 4.579.3%measured
49Kimi K2.7 Code79.3%measured
50Hy379.0%measured
51Muse Spark 1.279.0%measured
52Qwen3.7 Max79.0%measured
53Claude Opus 4.7 (Adaptive)78.7%measured
54GLM-5.278.3%measured
55Ling 3.0 Flash VL78.3%measured
56MiniMax M2.778.3%measured
57Qwen3.6 Plus78.3%measured
58GPT-5 (high)78.2%measured
59Claude Opus 4.6 (Adaptive)78.0%measured
60Kimi K2.578.0%measured
61Kimi K2.5 (Reasoning)78.0%measured
62Muse Spark78.0%measured
63Claude Opus 4.877.7%measured
64Muse Spark 1.177.7%measured
65Qwen3.5-27B77.7%measured
66Claude Opus 4.5 Thinking77.3%measured
67Inkling77.3%measured
68Qwen3.6-27B77.3%measured
69GPT-5.4 mini77.0%measured
70Ternary Bonsai 2 27B77.0%measured
71GPT-5.4 nano76.7%measured
72Grok 4.776.7%measured
73Quasar 438B76.3%measured
74Qwen3.5-122B-A10B76.3%measured
75Claude 4.1 Opus Thinking76.0%measured
76Gemini 3.5 Flash-Lite76.0%measured
77Gemini 3 Pro76.0%measured
78GPT-5 (medium)76.0%measured
79Sakana Fugu-Ultra75.9%estimated ± 4.5 pp, low confidence
80Qwen3.8 Max75.8%estimated ± 4.5 pp, low confidence
81Claude Opus 4.775.7%measured
82GLM-575.7%measured
83Inkling-Small75.7%measured
84MiMo-V2-Omni75.0%measured
85Sakana Fugu74.9%estimated ± 4.5 pp, medium confidence
86o374.7%measured
87MiMo-V2.6-Flash74.3%measured
88Grok 4.1 Fast (Reasoning)74.0%measured
89GLM-5.173.7%measured
90Grok 4 Fast (Reasoning)73.7%measured
91Step 3.7 Flash73.7%measured
92Agents-A173.3%estimated ± 7.0 pp, low confidence
93Beam73.3%estimated ± 7.0 pp, low confidence
94Agents-A1-4B73.3%estimated ± 7.0 pp, low confidence
95Ling 3.0 Flash73.0%measured
96Ling 3.0 Flash FP873.0%measured
97Qwen3.7 Plus73.0%measured
98Qwen3.5-35B-A3B72.0%measured
99GLM-5-Turbo71.7%measured
100Qwen3.6-35B-A3B71.7%measured
101GLM-4.771.0%measured
102Solar Pro 471.0%measured
103Claude Opus 4.570.7%measured
104GLM-5V-Turbo70.3%measured
105Pokee-Isaac 28B69.8%estimated ± 4.5 pp, medium confidence
106Gemma 4 31B69.7%measured
107Gemini 3.5 Flash69.3%measured
108GPT-5.1-Codex69.3%measured
109GPT-5.1-Codex-Max69.3%measured
110Mistral Medium 3.5 128B69.3%measured
111Gemini 2.5 Pro69.0%measured
112Claude Sonnet 4.668.3%measured
113GPT-4.168.3%measured
114MiMo-V2-Pro68.3%measured
115Grok 468.0%measured
116Mercury 2.568.0%measured
117Claude Opus 4.667.0%measured
118Nemotron 3 Ultra67.0%measured
119Hy3 Preview66.7%measured
120A.X K266.0%measured
121Gemma 4 26B A4B65.7%measured
122Nemotron 3 Super 100B65.7%measured
123o165.0%measured
124Grok 4.364.3%measured
125Qwen3.5 397B64.3%measured
126Qwen3.5 397B (Reasoning)64.3%measured
127Gemma 4 12B63.7%measured
128Solar Open 262.3%measured
129K-Exaone61.3%measured
130Ling 3.0 Tiny60.3%measured
131MiniCPM5-2B59.0%measured
132DeepSeek V3.1 (Reasoning)56.7%measured
133LLaDA2.2-mini56.5%estimated ± 7.0 pp, low confidence
134K-EXAONE 2.056.2%measured
135DeepSeek-R155.7%measured
136Gemini 3 Flash55.3%measured
137Grok Code Fast 153.0%measured
138Kimi K253.0%measured
139Command A+52.7%measured
140GPT-OSS 120B52.0%measured
141Llama 4 Maverick50.0%measured
142Qwen3 Max50.0%measured
143Gemini 2.5 Flash49.9%measured
144Mistral Small 449.7%measured
145Mistral Small 4 (Reasoning)49.7%measured
146GPT-4o49.3%measured
147Nemotron 3.5 Lightning 30B A3B NVFP449.2%measured
148Granite 4.2 30B49.0%measured
149DeepSeek V3.147.0%measured
150GLM-4.5-Air46.7%measured
151DeepSeek V3.245.7%measured
152Granite 4.2 8B45.0%measured
153Claude 4 Sonnet44.0%measured
154GPT-4.1 mini44.0%measured
155DeepSeek V3 032440.7%measured
156Nemotron 3 Nano Omni 30B A3B39.7%measured
157Celeris-138.0%measured
158Nemotron 3 Nano 30B38.0%measured
159Trinity-Large-Preview38.0%measured
160Trinity-Large-Thinking38.0%measured
161North Mini Code37.3%measured
162MiMo-V2-Flash36.3%measured
163Mistral Large 336.0%measured
164GPT-OSS 20B34.7%measured
165Solar Pro 332.3%measured
166Gemma 4 E4B32.0%measured
167Grok 4.1 Fast31.3%measured
168Ling 2.6 Flash31.3%measured
169Mistral Medium 331.3%measured
170DeepSeek V329.3%measured
171Claude 3 Haiku27.7%measured
172Llama 4 Scout27.7%measured
173GLM-4.626.3%measured
174Llama 3.1 405B25.3%measured
175Granite 4.2 3B24.3%measured
176Nova Pro21.0%measured
177GPT-4.1 nano20.3%measured
178Gemma 4 E2B16.3%measured
179Ultravox v0.6 Llama 3.3 70B15.7%measured
180DeepSeek R1 Distill Qwen 32B8.7%measured
181Gemma 3 27B7.3%measured
182Granite-4.0-H-1B7.0%measured
183LFM2.5-2.6B5.7%measured
184Exaone 4.0 1.2B0.0%measured
185Granite-4.0-350M0.0%measured
186Granite-4.0-H-350M0.0%measured
187LFM2.5-8B-A1B0.0%measured
188LFM2.5-VL-1.6B-Extract0.0%measured
189Phi-40.0%measured
190Qwen3-Omni-30B-A3B-Instruct0.0%measured
191Qwen3-Omni-30B-A3B-Thinking0.0%measured
192Sarvam 105B0.0%measured
193Sarvam 30B0.0%measured
194Solar Pro 20.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General