Calibration
Terminal-Bench 2.1 (Vals AI) → Terminal-Bench 2.0
Terminal-Bench 2.0 is estimated from Terminal-Bench 2.1 (Vals AI) with a Michaelis–Menten curve fitted on 18 models measured on both: y = 1.9912·x / (1.19573 + x), R² = 0.76, cross-validated error 5.9 pp. It is used for 43 estimates.
| Estimated model | Terminal-Bench 2.1 (Vals AI) | Terminal-Bench 2.0 | Source |
|---|---|---|---|
| Claude Fable 5 | 80.5% | 80.1% | estimated ± 5.9 pp, low confidence |
| Claude Fable 5.1 | 85.0% | 82.7% | estimated ± 5.9 pp, low confidence |
| Claude Haiku 4.5 | 43.8% | 53.4% | estimated ± 5.9 pp, medium confidence |
| Claude Opus 4.7 | 68.5% | 72.5% | estimated ± 5.9 pp, medium confidence |
| Claude Opus 4.8 | 71.9% | 74.8% | estimated ± 5.9 pp, medium confidence |
| Claude Opus 5 | 84.6% | 82.5% | estimated ± 5.9 pp, low confidence |
| Claude Sonnet 5 | 74.5% | 76.4% | estimated ± 5.9 pp, medium confidence |
| Command A+ | 17.6% | 25.5% | estimated ± 5.9 pp, low confidence |
| DeepSeek V4.1 Flash | 74.5% | 76.4% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.1 Flash-Lite | 34.1% | 44.2% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.1 Pro | 70.8% | 74.1% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.5 Flash | 74.2% | 76.2% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.5 Flash-Lite | 50.2% | 58.9% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.6 Flash | 73.8% | 76.0% | estimated ± 5.9 pp, medium confidence |
| Gemini 3.7 Flash | 77.5% | 78.3% | estimated ± 5.9 pp, low confidence |
| Gemini 3.8 Flash | 81.3% | 80.6% | estimated ± 5.9 pp, low confidence |
| Gemini 3 Flash | 53.9% | 61.9% | estimated ± 5.9 pp, medium confidence |
| GLM-5.2 | 67.8% | 72.1% | estimated ± 5.9 pp, medium confidence |
| GLM-5.3 | 71.5% | 74.5% | estimated ± 5.9 pp, medium confidence |
| GLM-5.3-Flash | 62.9% | 68.6% | estimated ± 5.9 pp, medium confidence |
| GPT-5.6 Luna | 79.0% | 79.2% | estimated ± 5.9 pp, low confidence |
| GPT-5.6 Sol | 85.8% | 83.2% | estimated ± 5.9 pp, low confidence |
| GPT-5.6 Terra | 77.5% | 78.3% | estimated ± 5.9 pp, low confidence |
| GPT-6 Astra | 87.3% | 84.0% | estimated ± 5.9 pp, low confidence |
| Grok 4.3 | 41.9% | 51.7% | estimated ± 5.9 pp, medium confidence |
| Grok 4.5 | 67.8% | 72.1% | estimated ± 5.9 pp, medium confidence |
| Grok 4.6 | 78.3% | 78.8% | estimated ± 5.9 pp, low confidence |
| Grok 4.7 | 73.4% | 75.7% | estimated ± 5.9 pp, medium confidence |
| Hy4 preview | 55.1% | 62.8% | estimated ± 5.9 pp, medium confidence |
| Inkling | 47.6% | 56.7% | estimated ± 5.9 pp, medium confidence |
| Inkling-Small | 55.1% | 62.8% | estimated ± 5.9 pp, medium confidence |
| Kimi K2.7 Code | 67.0% | 71.5% | estimated ± 5.9 pp, medium confidence |
| Kimi K3 | 80.9% | 80.4% | estimated ± 5.9 pp, low confidence |
| Ling 3.0 Flash | 50.2% | 58.9% | estimated ± 5.9 pp, medium confidence |
| Mercury 2.5 | 34.5% | 44.6% | estimated ± 5.9 pp, medium confidence |
| MiniMax M3 | 53.6% | 61.6% | estimated ± 5.9 pp, medium confidence |
| Mistral Medium 3.5 128B | 39.0% | 49.0% | estimated ± 5.9 pp, medium confidence |
| Muse Spark 1.1 | 69.3% | 73.1% | estimated ± 5.9 pp, medium confidence |
| Muse Spark 1.2 | 69.7% | 73.3% | estimated ± 5.9 pp, medium confidence |
| Muse Spark 1.3 | 72.3% | 75.0% | estimated ± 5.9 pp, medium confidence |
| Nemotron 3 Ultra | 50.9% | 59.5% | estimated ± 5.9 pp, medium confidence |
| Qwen3.8-27B | 58.4% | 65.3% | estimated ± 5.9 pp, medium confidence |
| Qwen3.8 Max | 67.4% | 71.8% | estimated ± 5.9 pp, medium confidence |