benchgap
Agentic · terminal

Terminal-Bench 2.0 leaderboard

As of 2026-10-07, the highest measured score on Terminal-Bench 2.0 is 82.0% by GPT-5.5. 43 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1GPT-6 Astra84.0%estimated ± 5.9 pp, low confidence
2GPT-5.6 Sol83.2%estimated ± 5.9 pp, low confidence
3Claude Fable 5.182.7%estimated ± 5.9 pp, low confidence
4Claude Opus 582.5%estimated ± 5.9 pp, low confidence
5GPT-5.582.0%measured
6Gemini 3.8 Flash80.6%estimated ± 5.9 pp, low confidence
7Kimi K380.4%estimated ± 5.9 pp, low confidence
8Claude Fable 580.1%estimated ± 5.9 pp, low confidence
9GPT-5.6 Luna79.2%estimated ± 5.9 pp, low confidence
10Grok 4.678.8%estimated ± 5.9 pp, low confidence
11Gemini 3.7 Flash78.3%estimated ± 5.9 pp, low confidence
12GPT-5.6 Terra78.3%estimated ± 5.9 pp, low confidence
13GPT-5.3 Codex77.3%measured
14Claude Sonnet 576.4%estimated ± 5.9 pp, medium confidence
15DeepSeek V4.1 Flash76.4%estimated ± 5.9 pp, medium confidence
16Gemini 3.5 Flash76.2%estimated ± 5.9 pp, medium confidence
17Gemini 3.6 Flash76.0%estimated ± 5.9 pp, medium confidence
18Grok 4.775.7%estimated ± 5.9 pp, medium confidence
19GPT-5.475.1%measured
20Muse Spark 1.375.0%estimated ± 5.9 pp, medium confidence
21Claude Opus 4.874.8%estimated ± 5.9 pp, medium confidence
22GLM-5.374.5%estimated ± 5.9 pp, medium confidence
23Gemini 3.1 Pro74.1%estimated ± 5.9 pp, medium confidence
24Muse Spark 1.273.3%estimated ± 5.9 pp, medium confidence
25Muse Spark 1.173.1%estimated ± 5.9 pp, medium confidence
26Claude Opus 4.772.5%estimated ± 5.9 pp, medium confidence
27GLM-5.272.1%estimated ± 5.9 pp, medium confidence
28Grok 4.572.1%estimated ± 5.9 pp, medium confidence
29Qwen3.8 Max71.8%estimated ± 5.9 pp, medium confidence
30Kimi K2.7 Code71.5%estimated ± 5.9 pp, medium confidence
31Qwen3.7 Plus70.3%measured
32Qwen3.7 Max69.7%measured
33Claude Opus 4.7 (Adaptive)69.4%measured
34Composer 2.569.3%measured
35GLM-5.3-Flash68.6%estimated ± 5.9 pp, medium confidence
36MiMo-V2.5-Pro68.4%measured
37DeepSeek V4 Pro 081367.9%measured
38Kimi K2.666.7%measured
39MiMo-V2.565.8%measured
40Claude Opus 4.665.4%measured
41Qwen 3.6 Max (preview)65.4%measured
42Qwen3.8-27B65.3%estimated ± 5.9 pp, medium confidence
43GLM-5.163.5%measured
44Hy4 preview62.8%estimated ± 5.9 pp, medium confidence
45Inkling-Small62.8%estimated ± 5.9 pp, medium confidence
46Gemini 3 Flash61.9%estimated ± 5.9 pp, medium confidence
47Composer 261.7%measured
48MiniMax M361.6%estimated ± 5.9 pp, medium confidence
49Qwen3.6 Plus61.6%measured
50GPT-5.4 mini60.0%measured
51Nemotron 3 Ultra59.5%estimated ± 5.9 pp, medium confidence
52Claude Opus 4.559.3%measured
53Qwen3.6-27B59.3%measured
54Claude Sonnet 4.659.1%measured
55Muse Spark59.0%measured
56Gemini 3.5 Flash-Lite58.9%estimated ± 5.9 pp, medium confidence
57Ling 3.0 Flash58.9%estimated ± 5.9 pp, medium confidence
58MiniMax M2.757.0%measured
59DeepSeek V4 Flash 073156.9%measured
60Inkling56.7%estimated ± 5.9 pp, medium confidence
61GLM-556.2%measured
62Hy3 Preview54.4%measured
63Claude Haiku 4.553.4%estimated ± 5.9 pp, medium confidence
64Qwen3.5 397B52.5%measured
65Grok 4.351.7%estimated ± 5.9 pp, medium confidence
66Qwen3.6-35B-A3B51.5%measured
67Kimi K2.550.8%measured
68Kimi K2.5 (Reasoning)50.8%measured
69Claude Sonnet 4.550.0%measured
70Qwen3.5-122B-A10B49.4%measured
71Mistral Medium 3.5 128B49.0%estimated ± 5.9 pp, medium confidence
72Grok 4.2047.1%measured
73GPT-5.4 nano46.3%measured
74MAI-Thinking-146.0%measured
75Laguna M.145.8%measured
76Mercury 2.544.6%estimated ± 5.9 pp, medium confidence
77Gemini 3.1 Flash-Lite44.2%estimated ± 5.9 pp, medium confidence
78Qwen3.5-27B41.6%measured
79GLM-4.741.0%measured
80Qwen3.5-35B-A3B40.5%measured
81Laguna XS 2.137.5%measured
82Laguna XS.235.7%measured
83LongCat-Flash-Lite-Sparse33.7%measured
84Command A+25.5%estimated ± 5.9 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General