benchgap
Agentic · terminal

Terminal-Bench 2.1 (Vals AI) leaderboard

As of 2026-10-07, the highest measured score on Terminal-Bench 2.1 (Vals AI) is 87.3% by GPT-6 Astra. 70 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Sonnet 5.598.6%estimated ± 4.6 pp, low confidence
2Claude Opus 5.594.5%estimated ± 4.6 pp, low confidence
3Claude Mythos 5.189.3%estimated ± 4.6 pp, low confidence
4GPT-6 Astra87.3%measured
5Gemini 4 Argon86.3%estimated ± 4.6 pp, medium confidence
6GPT-5.6 Sol85.8%measured
7Claude Fable 5.185.0%measured
8Claude Opus 584.6%measured
9Pareto 26.981.8%estimated ± 4.6 pp, medium confidence
10Pareto 26.10 Preview81.7%estimated ± 4.6 pp, medium confidence
11Gemini 3.8 Flash81.3%measured
12Kimi K380.9%measured
13Claude Fable 580.5%measured
14GPT-5.6 Luna79.0%measured
15GPT-6.1 Sol78.9%estimated ± 8.5 pp, medium confidence
16Grok 4.678.3%measured
17GPT-6 Sol78.0%estimated ± 8.5 pp, medium confidence
18Ling 3.1 Flash77.7%estimated ± 4.6 pp, medium confidence
19Gemini 3.7 Flash77.5%measured
20GPT-5.6 Terra77.5%measured
21Claude Haiku 5.577.4%estimated ± 4.6 pp, medium confidence
22MiMo-V2.6-Pro76.8%estimated ± 4.6 pp, medium confidence
23Step 5 Preview76.6%estimated ± 4.6 pp, medium confidence
24GPT-5.576.4%measured
25MiMo-V2.6-Flash76.3%estimated ± 4.6 pp, medium confidence
26SWE-276.2%estimated ± 4.6 pp, medium confidence
27Mistral Large 475.6%estimated ± 8.5 pp, medium confidence
28Ornith-1.5-397B75.0%estimated ± 3.4 pp, high confidence
29Claude Sonnet 574.5%measured
30DeepSeek V4.1 Flash74.5%measured
31Gemini 3.5 Flash74.2%measured
32Claude Mythos 573.9%estimated ± 7.4 pp, medium confidence
33Gemini 3.6 Flash73.8%measured
34Grok 4.773.4%measured
35Muse Spark 1.372.3%measured
36Claude Opus 4.871.9%measured
37GLM-5.371.5%measured
38Gemini 3.1 Pro70.8%measured
39GPT-6 Luna70.3%estimated ± 8.5 pp, medium confidence
40Muse Spark 1.269.7%measured
41Sakana Fugu-Ultra69.4%estimated ± 7.4 pp, medium confidence
42Muse Spark 1.169.3%measured
43Ember-169.3%estimated ± 7.4 pp, medium confidence
44SWE-1.768.9%estimated ± 7.4 pp, medium confidence
45Claude Opus 4.768.5%measured
46GPT-5.3 Codex68.0%estimated ± 6.3 pp, medium confidence
47Sakana Fugu67.9%estimated ± 7.4 pp, medium confidence
48Beam67.8%estimated ± 7.4 pp, medium confidence
49GLM-5.267.8%measured
50Grok 4.567.8%measured
51Qwen3.8 Max67.4%measured
52DeepSeek V4 Flash 073167.0%measured
53Kimi K2.7 Code67.0%measured
54Atria Dawn Preview66.4%estimated ± 7.4 pp, medium confidence
55GPT-5.466.0%estimated ± 6.3 pp, medium confidence
56Ornith-1.0-397B65.8%estimated ± 7.4 pp, medium confidence
57dots3-note Preview64.0%estimated ± 7.4 pp, medium confidence
58GLM-5.3-Flash62.9%measured
59Ornith-1.5-35B-A3B61.7%estimated ± 3.4 pp, high confidence
60Qwen3.7 Max61.0%measured
61Claude Opus 4.7 (Adaptive)61.0%estimated ± 6.3 pp, medium confidence
62Seed 2.1 Pro60.8%estimated ± 7.4 pp, medium confidence
63MiMo-V2.560.7%measured
64Apodex 1.160.6%estimated ± 7.4 pp, medium confidence
65Laguna S 2.160.2%estimated ± 7.4 pp, medium confidence
66Quasar 438B59.5%estimated ± 7.4 pp, medium confidence
67Composer 2.558.4%measured
68Qwen3.8-27B58.4%measured
69Seed 2.1 Turbo58.2%estimated ± 7.4 pp, medium confidence
70Claude Opus 4.657.4%estimated ± 6.3 pp, medium confidence
71Qwen 3.6 Max (preview)57.4%estimated ± 6.3 pp, medium confidence
72Claude Sonnet 4.657.3%measured
73MiMo-V2.5-Pro57.3%measured
74GLM-5.156.9%measured
75Pokee-Isaac 28B56.2%estimated ± 7.4 pp, medium confidence
76Ornith-1.0-35B55.6%estimated ± 7.4 pp, medium confidence
77Hy4 preview55.1%measured
78Inkling-Small55.1%measured
79DeepSeek V4 Pro 081354.7%measured
80GPT-5.4 mini54.7%measured
81MAI-Code-1.1-Flash54.5%estimated ± 7.4 pp, medium confidence
82Composer 254.1%estimated ± 6.3 pp, medium confidence
83Gemini 3 Flash53.9%measured
84Kimi K2.653.6%measured
85MiniMax M353.6%measured
86Qwen3.6 Plus53.2%measured
87Qwen3.7 Plus52.8%measured
88Claude Opus 4.552.0%estimated ± 6.3 pp, medium confidence
89Qwen3.6-27B52.0%estimated ± 6.3 pp, medium confidence
90Step 3.7 Flash51.9%estimated ± 7.4 pp, medium confidence
91Muse Spark51.7%estimated ± 6.3 pp, medium confidence
92Muse Glimmer 30B51.1%estimated ± 6.0 pp, low confidence
93Nemotron 3 Ultra50.9%measured
94Gemini 3.5 Flash-Lite50.2%measured
95Ling 3.0 Flash50.2%measured
96Solar Pro 450.0%estimated ± 7.4 pp, medium confidence
97GLM-549.2%estimated ± 6.3 pp, medium confidence
98MiniMax M2.748.7%measured
99Hy3 Preview47.6%estimated ± 6.3 pp, medium confidence
100Inkling47.6%measured
101Ternary Bonsai 2 27B46.7%estimated ± 7.4 pp, low confidence
102Qwen3.5 397B45.9%estimated ± 6.3 pp, medium confidence
103Qwen3.6-35B-A3B45.0%estimated ± 6.3 pp, medium confidence
104Kimi K2.544.4%estimated ± 6.3 pp, medium confidence
105Kimi K2.5 (Reasoning)44.4%estimated ± 6.3 pp, medium confidence
106Grok 4.2044.2%measured
107Claude Haiku 4.543.8%measured
108Claude Sonnet 4.543.7%estimated ± 6.3 pp, medium confidence
109Qwen3.5-122B-A10B43.2%estimated ± 6.3 pp, medium confidence
110Grok 4.341.9%measured
111Ornith-1.5-9B41.6%estimated ± 7.4 pp, low confidence
112GPT-5.4 nano41.6%measured
113MAI-Thinking-140.2%estimated ± 6.3 pp, medium confidence
114K-EXAONE 2.039.8%estimated ± 7.4 pp, low confidence
115Ornith-1.0-9B39.3%estimated ± 7.4 pp, low confidence
116Mistral Medium 3.5 128B39.0%measured
117Qwen3.5-27B36.2%estimated ± 6.3 pp, medium confidence
118GLM-4.735.7%estimated ± 6.3 pp, medium confidence
119Qwen3.5-35B-A3B35.3%estimated ± 6.3 pp, medium confidence
120Mercury 2.534.5%measured
121Gemini 3.1 Flash-Lite34.1%measured
122Laguna M.134.1%measured
123A.X K233.8%estimated ± 7.4 pp, low confidence
124Laguna XS 2.132.6%estimated ± 6.3 pp, medium confidence
125LongCat-Flash-Lite-Sparse29.2%estimated ± 6.3 pp, low confidence
126Granite 4.2 30B28.5%estimated ± 7.4 pp, low confidence
127Laguna XS.225.8%measured
128Nemotron 3.5 Lightning 30B A3B NVFP424.1%estimated ± 7.4 pp, low confidence
129Granite 4.2 8B21.8%estimated ± 7.4 pp, low confidence
130Command A+17.6%measured
131MiniCPM5-2B12.6%estimated ± 7.4 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General