benchgap
Instruction following

AA-IFBench leaderboard

As of 2026-10-07, the highest measured score on AA-IFBench is 82.9% by MiniMax M3. 38 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1MiniMax M382.9%measured
2Nemotron 3 Ultra81.4%measured
3Grok 4.381.3%measured
4Qwen3.7 Max80.5%measured
5MAI-Thinking-180.3%estimated ± 8.5 pp, low confidence
6Qwen3.8 Max80.3%estimated ± 8.5 pp, low confidence
7Inkling-Small80.3%estimated ± 8.5 pp, low confidence
8Qwen3.8-Omni-Flash80.3%estimated ± 8.5 pp, medium confidence
9Qwen3.8-Flash-Next80.3%estimated ± 8.5 pp, medium confidence
10Solar Open 280.3%estimated ± 8.5 pp, medium confidence
11Inkling80.3%estimated ± 8.5 pp, medium confidence
12Beam80.3%estimated ± 8.5 pp, medium confidence
13Qwen3.8-27B80.3%estimated ± 8.5 pp, medium confidence
14Granite 4.2 8B80.3%estimated ± 8.5 pp, medium confidence
15Agents-A179.9%estimated ± 8.2 pp, medium confidence
16MiMo-V2.5-Pro79.9%measured
17Agents-A1-4B79.8%estimated ± 8.2 pp, medium confidence
18Granite 4.2 30B79.1%estimated ± 8.5 pp, medium confidence
19Mercury 2.578.8%estimated ± 8.5 pp, medium confidence
20Muse Glimmer 30B78.8%estimated ± 8.5 pp, medium confidence
21Qwen3.7 Plus78.0%measured
22GPT-5.2-Codex77.6%measured
23Gemini 3.1 Pro77.1%measured
24Qwen 3.6 Max (preview)76.6%measured
25DeepSeek V4 Pro 081376.5%measured
26Gemini 3.5 Flash76.3%measured
27GLM-5.176.3%measured
28Kimi K2.676.0%measured
29GPT-5.4 nano75.9%measured
30GPT-5.575.9%measured
31Muse Spark75.9%measured
32MiniMax M2.775.7%measured
33Qwen3.5-122B-A10B75.7%measured
34Gemma 4 31B75.6%measured
35Qwen3.5-27B75.6%measured
36GPT-5.275.4%measured
37GPT-5.3 Codex75.4%measured
38Qwen3.6 Plus75.2%measured
39A.X K275.1%estimated ± 8.5 pp, medium confidence
40Command A+73.9%measured
41GPT-5.473.9%measured
42Gemma 4 12B73.5%measured
43GLM-5.273.3%measured
44GPT-5.4 mini73.3%measured
45GLM-5-Turbo73.2%measured
46GPT-5 (high)73.1%measured
47GPT-5.172.9%measured
48dots3-note Preview72.8%estimated ± 8.2 pp, medium confidence
49o3-mini72.8%estimated ± 8.2 pp, medium confidence
50GPT-5.6 Sol72.7%measured
51Qwen3.5-35B-A3B72.5%measured
52Gemma 4 26B A4B72.4%measured
53GLM-572.3%measured
54Nemotron 3 Super 100B71.5%measured
55o371.4%measured
56GPT-5.6 Terra71.2%measured
57Solar Pro 371.2%measured
58Nemotron 3 Nano 30B71.1%measured
59GPT-5 (medium)70.6%measured
60Gemini 3 Pro70.4%measured
61o170.3%measured
62Kimi K2.570.2%measured
63Kimi K2.5 (Reasoning)70.2%measured
64GPT-5.1-Codex70.0%measured
65GPT-5.1-Codex-Max70.0%measured
66GPT-OSS 120B69.0%measured
67MiMo-V2-Pro68.8%measured
68Mistral Medium 3.5 128B68.8%measured
69GLM-4.767.9%measured
70Qwen3.6-27B67.6%measured
71Step 3.7 Flash67.3%measured
72Ling 3.0 Flash65.4%estimated ± 8.5 pp, medium confidence
73GPT-OSS 20B65.1%measured
74K-Exaone64.7%measured
75Qwen3.6-35B-A3B64.4%measured
76Granite 4.2 3B64.2%estimated ± 8.5 pp, medium confidence
77Claude Fable 563.5%measured
78Nemotron 3 Nano Omni 30B A3B63.2%measured
79Kimi K2.7 Code63.1%measured
80K-EXAONE 2.063.0%estimated ± 8.2 pp, medium confidence
81Claude Opus 4.862.2%measured
82GLM-5V-Turbo61.1%measured
83Ling 3.0 Flash FP859.7%estimated ± 8.5 pp, medium confidence
84Claude Opus 4.7 (Adaptive)58.6%measured
85Nemotron 3.5 Lightning 30B A3B NVFP458.4%estimated ± 8.5 pp, medium confidence
86Claude Opus 4.5 Thinking58.0%measured
87North Mini Code57.6%measured
88Ling 2.6 Flash57.4%measured
89Ternary Bonsai 2 27B57.0%estimated ± 8.2 pp, medium confidence
90Hy3 Preview56.8%estimated ± 8.5 pp, medium confidence
91LFM2.5-2.6B56.8%estimated ± 8.5 pp, medium confidence
92LLaDA2.2-mini56.8%estimated ± 8.5 pp, low confidence
93Trinity-Large-Preview56.3%measured
94Trinity-Large-Thinking56.3%measured
95LFM2.5-8B-A1B55.6%measured
96Claude 4.1 Opus Thinking55.4%measured
97Gemini 3 Flash55.1%measured
98Grok 453.7%measured
99MiMo-V2-Omni53.5%measured
100Claude Opus 4.6 (Adaptive)53.1%measured
101Grok 4.1 Fast (Reasoning)52.7%measured
102Qwen3.5 397B51.6%measured
103Qwen3.5 397B (Reasoning)51.6%measured
104Grok 4 Fast (Reasoning)50.5%measured
105DeepSeek V3.249.0%measured
106Gemini 2.5 Pro48.7%measured
107Mistral Small 448.2%measured
108Mistral Small 4 (Reasoning)48.2%measured
109Ultravox v0.6 Llama 3.3 70B47.1%measured
110Claude 4 Sonnet45.4%measured
111Claude Opus 4.644.6%measured
112Gemma 4 E4B44.2%measured
113Qwen3 Max44.1%measured
114Claude Opus 4.743.6%measured
115Qwen3-Omni-30B-A3B-Thinking43.4%measured
116Claude Opus 4.543.0%measured
117GPT-4.143.0%measured
118Llama 4 Maverick43.0%measured
119DeepSeek V3.1 (Reasoning)41.5%measured
120Kimi K241.5%measured
121Grok Code Fast 141.4%measured
122Claude Sonnet 4.641.2%measured
123DeepSeek V3 032441.0%measured
124MiMo-V2-Flash39.9%measured
125DeepSeek-R139.6%measured
126Llama 4 Scout39.5%measured
127Mistral Medium 339.3%measured
128Gemini 2.5 Flash39.0%measured
129Llama 3.1 405B39.0%measured
130GPT-4.1 mini38.3%measured
131MiniCPM5-2B38.2%estimated ± 8.2 pp, medium confidence
132Nemotron Ultra 253B38.2%measured
133Nova Pro38.1%measured
134Gemma 4 E2B38.0%measured
135DeepSeek V3.137.8%measured
136GLM-4.5-Air37.6%measured
137GLM-4.636.7%measured
138Grok 4.1 Fast36.5%measured
139Mistral Large 336.2%measured
140Claude 3 Haiku36.1%measured
141ZAYA1-8B34.8%estimated ± 8.2 pp, medium confidence
142DeepSeek V334.8%measured
143Sarvam 105B34.4%measured
144GPT-4o34.3%measured
145Solar Pro 233.7%measured
146Exaone 4.0 32B33.5%measured
147LFM2.5-VL-1.6B-Extract33.1%measured
148GPT-4.1 nano32.0%measured
149Gemma 3 27B31.8%measured
150Mistral Large 231.2%measured
151Qwen3-Omni-30B-A3B-Instruct31.2%measured
152GPT-4o mini31.0%measured
153LFM2.5-VL-3B26.5%estimated ± 8.2 pp, low confidence
154Sarvam 30B26.5%measured
155Granite-4.0-H-1B26.2%measured
156Exaone 4.0 1.2B25.3%measured
157Kanana-2 3B Instruct23.7%estimated ± 8.2 pp, low confidence
158Phi-423.5%measured
159Celeris-123.4%estimated ± 8.2 pp, low confidence
160DeepSeek R1 Distill Qwen 32B22.9%measured
161MiniCPM5-1B22.6%estimated ± 8.2 pp, low confidence
162Kanana-2 1.3B Instruct17.8%estimated ± 8.2 pp, low confidence
163Granite-4.0-H-350M17.6%measured
164Mellum2-12B-A2.5B-Thinking16.1%estimated ± 8.2 pp, low confidence
165Granite-4.0-350M15.9%measured
166Mellum2-12B-A2.5B-Instruct15.0%estimated ± 8.2 pp, low confidence
167LFM2.5-230M9.9%estimated ± 8.2 pp, low confidence
168LFM2.5-VL-450M0.8%estimated ± 8.2 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General