benchgap
Agentic · tools

τ²-bench results leaderboard

As of 2026-10-07, the highest measured score on τ²-bench results is 99.1% by GLM-5.2. 55 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1BTL-3100.0%estimated ± 14.1 pp, low confidence
2Claude Opus 5.599.9%estimated ± 4.8 pp, low confidence
3Muse Spark 1.399.9%estimated ± 4.8 pp, low confidence
4Grok 4.799.9%estimated ± 4.8 pp, low confidence
5GLM-5.299.1%measured
6GPT-5.498.9%measured
7Claude Fable 598.5%measured
8GLM-5-Turbo98.5%measured
9GLM-5V-Turbo98.5%measured
10Step 3.7 Flash98.5%measured
11GLM-598.2%measured
12GPT-5.598.0%measured
13GLM-5.197.7%measured
14Grok 4.397.7%measured
15Qwen3.6 Plus97.7%measured
16DeepSeek V4 Pro 081396.2%measured
17Grok 4.696.0%estimated ± 2.4 pp, medium confidence
18GLM-4.795.9%measured
19Kimi K2.695.9%measured
20Kimi K2.595.9%measured
21Kimi K2.5 (Reasoning)95.9%measured
22Qwen 3.6 Max (preview)95.9%measured
23Qwen3.8 Max Preview95.6%estimated ± 7.3 pp, medium confidence
24Gemini 3.1 Pro95.6%measured
25Step 5 Preview95.6%estimated ± 2.4 pp, medium confidence
26GPT-5.6 Luna95.4%estimated ± 7.3 pp, medium confidence
27Gemini 3.5 Flash95.3%measured
28Qwen3.6-35B-A3B95.3%measured
29Apodex 1.195.2%estimated ± 7.3 pp, medium confidence
30Apodex 1.1 Mini95.2%estimated ± 7.3 pp, medium confidence
31MiMo-V2-Pro95.0%measured
32Atria Dawn Preview94.8%estimated ± 14.1 pp, low confidence
33Kimi K394.8%estimated ± 2.4 pp, medium confidence
34Qwen3.7 Max94.7%measured
35Claude Opus 4.894.4%measured
36Gemini 3.7 Flash94.3%estimated ± 7.1 pp, low confidence
37Qwen3.8-27B94.3%estimated ± 2.4 pp, medium confidence
38Claude Sonnet 5.594.3%estimated ± 7.1 pp, low confidence
39Muse Spark 1.294.2%estimated ± 13.3 pp, low confidence
40MiMo-V2.5-Pro94.2%measured
41Mistral Medium 3.5 128B94.2%measured
42Qwen3.6-27B94.2%measured
43Claude Opus 594.2%estimated ± 7.1 pp, low confidence
44Grok 4.594.1%estimated ± 13.3 pp, low confidence
45DeepSeek V4 Flash 073194.1%estimated ± 13.3 pp, low confidence
46GPT-6.1 Sol94.1%estimated ± 7.1 pp, low confidence
47Qwen3.5-27B93.9%measured
48Qwen3.5-122B-A10B93.6%measured
49GPT-5.4 mini93.4%measured
50Quasar 438B93.3%estimated ± 13.3 pp, low confidence
51Grok 4.1 Fast (Reasoning)93.3%measured
52Gemini 3.6 Flash93.0%estimated ± 13.3 pp, low confidence
53Qwen3.7 Plus93.0%measured
54Muse Spark 1.192.6%estimated ± 13.3 pp, low confidence
55GPT-5.4 nano92.5%measured
56BTL-492.5%estimated ± 14.1 pp, low confidence
57Hy392.3%estimated ± 13.3 pp, low confidence
58Hy3 Preview92.3%estimated ± 13.3 pp, low confidence
59Inkling-Small92.2%estimated ± 13.3 pp, low confidence
60Claude Opus 4.6 (Adaptive)92.1%measured
61GPT-5.2-Codex92.1%measured
62Muse Spark91.5%measured
63Ling 3.0 Flash91.3%estimated ± 13.3 pp, low confidence
64Ling 3.0 Flash FP891.3%estimated ± 13.3 pp, low confidence
65MiMo-V2-Omni91.2%measured
66Inkling91.1%estimated ± 2.4 pp, medium confidence
67Pokee-Isaac 28B90.7%estimated ± 14.1 pp, low confidence
68GLM-5.390.1%estimated ± 2.4 pp, medium confidence
69Kimi K2.7 Code90.1%measured
70Trinity-Large-Preview90.1%measured
71Trinity-Large-Thinking90.1%measured
72Gemini 3.5 Flash-Lite89.6%estimated ± 13.3 pp, low confidence
73Claude Opus 4.5 Thinking89.5%measured
74Qwen3.5-35B-A3B89.2%measured
75Muse Glimmer 30B89.0%estimated ± 2.4 pp, medium confidence
76DeepSeek V4.1 Flash89.0%estimated ± 4.8 pp, medium confidence
77MiniMax M388.9%measured
78Claude Opus 4.7 (Adaptive)88.6%measured
79Claude Sonnet 588.6%estimated ± 8.8 pp, low confidence
80LFM2.5-8B-A1B88.1%measured
81GLM-5.3-Flash88.0%estimated ± 2.4 pp, medium confidence
82MiniCPM5-2B87.6%estimated ± 14.1 pp, low confidence
83Gemini 3 Pro87.1%measured
84GPT-5 (medium)86.5%measured
85Claude Opus 4.586.3%measured
86GPT-5.6 Terra86.3%measured
87Solar Pro 386.3%measured
88GPT-5.3 Codex86.0%measured
89Ling 2.6 Flash86.0%measured
90GPT-6 Astra85.6%estimated ± 4.8 pp, medium confidence
91GPT-6 Sol85.4%estimated ± 4.8 pp, medium confidence
92Claude Fable 5.185.4%estimated ± 4.8 pp, medium confidence
93Gemini 3.8 Flash85.4%estimated ± 4.8 pp, medium confidence
94GPT-5.6 Sol85.1%measured
95Command A+85.0%measured
96Claude Opus 4.684.8%measured
97GPT-5.284.8%measured
98GPT-5 (high)84.8%measured
99MiniMax M2.784.8%measured
100MiMo-V2-Flash83.9%measured
101Qwen3.5 397B83.9%measured
102Qwen3.5 397B (Reasoning)83.9%measured
103Granite 4.2 30B83.6%estimated ± 14.1 pp, low confidence
104Nemotron 3 Ultra83.3%measured
105GPT-5.1-Codex83.0%measured
106GPT-5.1-Codex-Max83.0%measured
107GPT-5.181.9%measured
108o380.7%measured
109LLaDA2.2-flash80.3%measured
110Ternary Bonsai 2 27B80.2%measured
111LFM2.5-2.6B79.9%estimated ± 14.1 pp, low confidence
112Nemotron 3.5 Lightning 30B A3B NVFP479.9%estimated ± 13.3 pp, low confidence
113Claude Sonnet 4.679.5%measured
114DeepSeek V3.278.9%measured
115Agents-A1-4B78.2%measured
116GLM-4.676.9%measured
117Granite 4.2 3B76.0%estimated ± 14.1 pp, low confidence
118Grok Code Fast 175.7%measured
119Grok 474.9%measured
120K-Exaone74.3%measured
121Qwen3 Max74.3%measured
122Claude Opus 4.774.0%measured
123Granite 4.2 8B71.6%estimated ± 13.3 pp, low confidence
124Claude 4.1 Opus Thinking71.4%measured
125Mellum2-12B-A2.5B-Thinking69.6%estimated ± 14.1 pp, low confidence
126Mellum2-12B-A2.5B-Instruct68.2%estimated ± 14.1 pp, low confidence
127Nemotron 3 Super 100B67.8%measured
128GPT-OSS 120B65.8%measured
129Grok 4 Fast (Reasoning)65.8%measured
130Grok 4.1 Fast63.7%measured
131ZAYA1-8B62.9%estimated ± 14.1 pp, low confidence
132o162.6%measured
133Kimi K261.1%measured
134GPT-OSS 20B60.2%measured
135Gemma 4 31B59.9%measured
136LLaDA2.2-mini57.5%measured
137LFM2.5-VL-3B55.1%estimated ± 14.1 pp, low confidence
138Gemini 2.5 Pro54.1%measured
139GPT-4.1 mini52.9%measured
140Claude 4 Sonnet52.3%measured
141DeepSeek V3 032447.1%measured
142GPT-4.147.1%measured
143Sarvam 105B46.8%measured
144GLM-4.5-Air46.5%measured
145MiniCPM5-1B45.5%estimated ± 14.1 pp, low confidence
146Nemotron 3 Nano Omni 30B A3B45.3%measured
147Gemma 4 26B A4B43.6%measured
148Gemini 3 Flash43.3%measured
149Mistral Small 441.2%measured
150Mistral Small 4 (Reasoning)41.2%measured
151Nemotron 3 Nano 30B40.9%measured
152LFM2.5-VL-450M39.6%estimated ± 14.1 pp, low confidence
153LFM2.5-230M39.5%estimated ± 14.1 pp, low confidence
154DeepSeek V3.1 (Reasoning)37.4%measured
155North Mini Code37.4%measured
156DeepSeek-R136.5%measured
157Gemma 4 12B36.3%measured
158DeepSeek V3.134.8%measured
159Sarvam 30B34.5%measured
160Celeris-132.0%estimated ± 13.3 pp, low confidence
161Solar Pro 231.9%measured
162Mistral Large 230.7%measured
163o3-mini28.7%measured
164Ultravox v0.6 Llama 3.3 70B26.6%measured
165GPT-4o25.1%measured
166Mistral Large 324.6%measured
167Mistral Medium 324.3%measured
168DeepSeek V322.8%measured
169Qwen3-Omni-30B-A3B-Thinking21.3%measured
170Claude 3 Haiku21.1%measured
171Gemma 4 E2B20.8%measured
172Gemma 4 E4B20.8%measured
173Exaone 4.0 1.2B20.5%measured
174Granite-4.0-H-1B19.6%measured
175Llama 3.1 405B19.0%measured
176Llama 4 Maverick17.8%measured
177GPT-4.1 nano17.3%measured
178Qwen3-Omni-30B-A3B-Instruct16.4%measured
179Llama 4 Scout15.5%measured
180Gemini 2.5 Flash14.9%measured
181Granite-4.0-H-350M14.6%measured
182Nova Pro14.0%measured
183Granite-4.0-350M13.2%measured
184Nemotron Ultra 253B11.4%measured
185Gemma 3 27B10.5%measured
186LFM2.5-VL-1.6B-Extract8.5%measured
187Exaone 4.0 32B4.1%measured
188Phi-40.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General