benchgap
Agentic · tools

τ³-Bench Banking leaderboard

As of 2026-10-07, the highest measured score on τ³-Bench Banking is 51.3% by Qwen3.8 Max. 28 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: artificial-analysis.

#ModelScoreSource
1Qwen3.8 Max51.3%measured
2Grok 4.6 (high)50.7%measured
3Muse Spark 1.3 (max)50.5%measured
4Gemini 3.7 Flash (medium)50.4%estimated ± 11.4 pp, low confidence
5GLM-5.3 (max)50.3%measured
6Gemini 3.5 Flash (high)50.3%estimated ± 11.4 pp, low confidence
7DeepSeek V4 Pro 0813 (max)50.1%estimated ± 11.4 pp, low confidence
8Qwen3.8 2.4T A95B49.1%measured
9Claude Opus 5.5 (max with fallback)49.0%estimated ± 2.6 pp, medium confidence
10Gemini 3.7 Flash (high)49.0%estimated ± 4.5 pp, low confidence
11Claude Sonnet 5.5 (max with fallback)48.3%estimated ± 4.5 pp, medium confidence
12Qwen3.8 27B (xhigh)48.0%measured
13Grok 4.7 (xhigh)48.0%estimated ± 2.6 pp, medium confidence
14GLM-5.2 (max)47.8%estimated ± 2.6 pp, medium confidence
15Qwen3.8 Max (0902)47.8%measured
16GPT-6 Astra (high)47.4%estimated ± 5.0 pp, medium confidence
17GPT-6 Astra (xhigh)47.4%estimated ± 5.0 pp, medium confidence
18Gemini 4 Argon (high)47.4%estimated ± 5.0 pp, low confidence
19MiMo-V2.6-Pro47.4%estimated ± 5.0 pp, medium confidence
20Mistral Large 4 Preview47.4%estimated ± 5.0 pp, medium confidence
21GPT-6 Luna (max)47.4%estimated ± 5.0 pp, medium confidence
22GPT-6.1 Sol (xhigh)47.4%estimated ± 5.0 pp, medium confidence
23Qwen3.8 27B (medium)47.4%measured
24Grok 4.6 (xhigh)47.4%estimated ± 5.0 pp, medium confidence
25Claude Fable 5.1 (max with fallback)47.2%measured
26GLM-5.3-Flash47.2%measured
27Muse Spark 1.3 (xhigh)47.2%measured
28Claude Opus 5 (max)47.1%estimated ± 4.5 pp, medium confidence
29GPT-5.5 (xhigh)47.0%estimated ± 2.6 pp, medium confidence
30Claude Opus 4.7 (max)46.8%estimated ± 2.6 pp, medium confidence
31DeepSeek V4.1 Flash (max)46.7%estimated ± 2.6 pp, medium confidence
32GPT-6 Sol (max)46.0%estimated ± 2.6 pp, medium confidence
33Kimi K3 (max)46.0%measured
34GPT-6.1 Sol (max)45.8%estimated ± 4.5 pp, medium confidence
35GPT-5.6 Terra (max)45.6%estimated ± 2.6 pp, medium confidence
36Claude Fable 5 (with fallback)45.3%estimated ± 4.5 pp, medium confidence
37Gemini 3.8 Flash (high)44.9%measured
38Step 5 Preview44.4%estimated ± 2.6 pp, low confidence
39GPT-5.6 Sol (max)44.2%estimated ± 2.6 pp, low confidence
40GPT-6 Astra (max)41.4%measured
41Claude Fable 5.1 (xhigh with fallback)40.5%estimated ± 10.4 pp, low confidence
42Claude Fable 5.1 (high with fallback)39.9%estimated ± 10.4 pp, low confidence
43K2 Horizon 375B A23B34.2%measured
44Inkling (xhigh)29.1%measured
45Muse Glimmer (high)23.5%measured
46MiniMax-M315.3%measured
47Nemotron 3 Ultra14.2%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Vision & documents