Calibration
Terminal-Bench 2.0 → Terminal-Bench 2.1 (Vals AI)
Terminal-Bench 2.1 (Vals AI) is estimated from Terminal-Bench 2.0 with a linear curve fitted on 18 models measured on both: y = 0.8891·x + -0.0075, R² = 0.75, cross-validated error 6.3 pp. It is used for 23 estimates.
| Estimated model | Terminal-Bench 2.0 | Terminal-Bench 2.1 (Vals AI) | Source |
|---|---|---|---|
| Claude Opus 4.5 | 59.3% | 52.0% | estimated ± 6.3 pp, medium confidence |
| Claude Opus 4.6 | 65.4% | 57.4% | estimated ± 6.3 pp, medium confidence |
| Claude Opus 4.7 (Adaptive) | 69.4% | 61.0% | estimated ± 6.3 pp, medium confidence |
| Claude Sonnet 4.5 | 50.0% | 43.7% | estimated ± 6.3 pp, medium confidence |
| Composer 2 | 61.7% | 54.1% | estimated ± 6.3 pp, medium confidence |
| GLM-4.7 | 41.0% | 35.7% | estimated ± 6.3 pp, medium confidence |
| GLM-5 | 56.2% | 49.2% | estimated ± 6.3 pp, medium confidence |
| GPT-5.3 Codex | 77.3% | 68.0% | estimated ± 6.3 pp, medium confidence |
| GPT-5.4 | 75.1% | 66.0% | estimated ± 6.3 pp, medium confidence |
| Hy3 Preview | 54.4% | 47.6% | estimated ± 6.3 pp, medium confidence |
| Kimi K2.5 | 50.8% | 44.4% | estimated ± 6.3 pp, medium confidence |
| Kimi K2.5 (Reasoning) | 50.8% | 44.4% | estimated ± 6.3 pp, medium confidence |
| Laguna XS 2.1 | 37.5% | 32.6% | estimated ± 6.3 pp, medium confidence |
| LongCat-Flash-Lite-Sparse | 33.7% | 29.2% | estimated ± 6.3 pp, low confidence |
| MAI-Thinking-1 | 46.0% | 40.2% | estimated ± 6.3 pp, medium confidence |
| Muse Spark | 59.0% | 51.7% | estimated ± 6.3 pp, medium confidence |
| Qwen3.5-122B-A10B | 49.4% | 43.2% | estimated ± 6.3 pp, medium confidence |
| Qwen3.5-27B | 41.6% | 36.2% | estimated ± 6.3 pp, medium confidence |
| Qwen3.5-35B-A3B | 40.5% | 35.3% | estimated ± 6.3 pp, medium confidence |
| Qwen3.5 397B | 52.5% | 45.9% | estimated ± 6.3 pp, medium confidence |
| Qwen3.6-27B | 59.3% | 52.0% | estimated ± 6.3 pp, medium confidence |
| Qwen3.6-35B-A3B | 51.5% | 45.0% | estimated ± 6.3 pp, medium confidence |
| Qwen 3.6 Max (preview) | 65.4% | 57.4% | estimated ± 6.3 pp, medium confidence |