benchgap
Agentic · terminal

Terminal-Bench 2.1 leaderboard

As of 2026-10-07, the highest measured score on Terminal-Bench 2.1 is 92.8% by SWE-2. 40 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1SWE-292.8%measured
2GPT-5.6 Sol91.9%measured
3Claude Opus 591.8%estimated ± 6.6 pp, low confidence
4DeepSeek V4.1 Flash90.6%measured
5MiMo-V2.6-Pro89.9%measured
6Claude Sonnet 5.589.9%estimated ± 3.9 pp, medium confidence
7Claude Opus 5.589.8%estimated ± 3.9 pp, medium confidence
8GPT-6 Astra89.7%estimated ± 3.9 pp, medium confidence
9Gemini 4 Argon89.7%estimated ± 3.9 pp, medium confidence
10GPT-6.1 Sol89.6%estimated ± 3.9 pp, medium confidence
11Claude Fable 5.189.5%estimated ± 3.9 pp, medium confidence
12Gemini 3.8 Flash89.4%measured
13GPT-6 Sol89.1%estimated ± 3.9 pp, medium confidence
14Muse Spark 1.388.8%measured
15Claude Haiku 5.588.4%estimated ± 3.9 pp, high confidence
16Kimi K388.3%measured
17GLM-5.388.2%measured
18Claude Mythos 588.0%measured
19DeepSeek V4 Pro 081387.9%measured
20Mistral Large 487.7%estimated ± 3.9 pp, high confidence
21MiMo-V2.6-Flash87.6%measured
22Grok 4.787.6%estimated ± 3.9 pp, high confidence
23GPT-5.6 Terra87.4%measured
24Qwen3.8 Max86.6%measured
25Ornith-1.5-397B86.1%measured
26GPT-5.585.8%estimated ± 6.9 pp, medium confidence
27Gemini 3.7 Flash85.8%measured
28Grok 4.685.8%estimated ± 6.6 pp, low confidence
29Hy4 preview85.4%measured
30Gemini 3.6 Flash85.2%estimated ± 6.9 pp, medium confidence
31Step 5 Preview85.0%measured
32GPT-5.6 Luna84.7%measured
33Claude Fable 584.3%measured
34GLM-5.3-Flash84.3%measured
35Gemini 3.1 Pro84.2%estimated ± 6.9 pp, medium confidence
36GPT-6 Luna84.0%estimated ± 3.9 pp, high confidence
37Claude Opus 4.783.3%estimated ± 6.9 pp, medium confidence
38Grok 4.583.3%measured
39Muse Spark 1.282.9%measured
40DeepSeek V4 Flash 073182.7%measured
41Kimi K2.7 Code82.6%estimated ± 6.9 pp, medium confidence
42Sakana Fugu-Ultra82.1%measured
43Ember-182.0%measured
44SWE-1.781.5%measured
45GLM-5.281.0%measured
46Claude Sonnet 580.4%measured
47Sakana Fugu80.2%measured
48Beam80.1%measured
49Muse Spark 1.180.0%measured
50Qwen3.7 Max78.5%estimated ± 6.9 pp, medium confidence
51Atria Dawn Preview78.3%measured
52MiMo-V2.578.3%estimated ± 6.9 pp, medium confidence
53Ornith-1.0-397B77.5%measured
54Gemini 3.5 Flash76.2%measured
55Composer 2.575.9%estimated ± 6.9 pp, medium confidence
56dots3-note Preview75.1%measured
57Claude Sonnet 4.674.6%estimated ± 6.9 pp, medium confidence
58MiMo-V2.5-Pro74.6%estimated ± 6.9 pp, medium confidence
59Claude Opus 4.874.6%measured
60GLM-5.174.1%estimated ± 6.9 pp, medium confidence
61Qwen3.8-27B73.0%measured
62GPT-5.4 mini71.0%estimated ± 6.9 pp, medium confidence
63Seed 2.1 Pro71.0%measured
64Apodex 1.170.8%measured
65Laguna S 2.170.2%measured
66Gemini 3 Flash69.7%estimated ± 6.9 pp, medium confidence
67Quasar 438B69.3%measured
68Kimi K2.669.2%estimated ± 6.9 pp, medium confidence
69Qwen3.6 Plus68.5%estimated ± 6.9 pp, medium confidence
70Qwen3.7 Plus67.8%estimated ± 6.9 pp, medium confidence
71Ornith-1.5-35B-A3B67.8%measured
72Seed 2.1 Turbo67.6%measured
73MiniMax M366.0%measured
74Pokee-Isaac 28B65.1%measured
75Inkling-Small64.7%measured
76Ornith-1.0-35B64.2%measured
77Inkling63.8%measured
78MAI-Code-1.1-Flash62.9%measured
79Step 3.7 Flash59.5%measured
80MiniMax M2.759.1%estimated ± 6.9 pp, medium confidence
81Ling 3.0 Flash57.0%measured
82Solar Pro 457.0%measured
83Nemotron 3 Ultra56.4%measured
84Gemini 3.5 Flash-Lite54.0%measured
85Ternary Bonsai 2 27B52.8%measured
86Muse Glimmer 30B51.7%measured
87Grok 4.2046.8%estimated ± 6.9 pp, low confidence
88Ornith-1.5-9B46.2%measured
89Claude Haiku 4.545.6%estimated ± 6.9 pp, low confidence
90K-EXAONE 2.043.8%measured
91Ornith-1.0-9B43.1%measured
92Grok 4.339.7%estimated ± 6.9 pp, low confidence
93GPT-5.4 nano38.8%estimated ± 6.9 pp, low confidence
94A.X K236.0%measured
95Mistral Medium 3.5 128B30.6%estimated ± 6.9 pp, low confidence
96Granite 4.2 30B29.2%measured
97Nemotron 3.5 Lightning 30B A3B NVFP423.5%measured
98Granite 4.2 8B20.6%measured
99Mercury 2.517.9%estimated ± 6.9 pp, low confidence
100Gemini 3.1 Flash-Lite16.9%estimated ± 6.9 pp, low confidence
101Laguna M.116.9%estimated ± 6.9 pp, low confidence
102MiniCPM5-2B8.6%measured
103Laguna XS.23.8%estimated ± 6.9 pp, low confidence
104Command A+0.4%estimated ± 6.9 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General