benchgap
Calibration

Terminal-Bench 2.0 → Terminal-Bench 2.1 (Vals AI)

Terminal-Bench 2.1 (Vals AI) is estimated from Terminal-Bench 2.0 with a linear curve fitted on 18 models measured on both: y = 0.8891·x + -0.0075, R² = 0.75, cross-validated error 6.3 pp. It is used for 23 estimates.

Estimated modelTerminal-Bench 2.0Terminal-Bench 2.1 (Vals AI)Source
Claude Opus 4.559.3%52.0%estimated ± 6.3 pp, medium confidence
Claude Opus 4.665.4%57.4%estimated ± 6.3 pp, medium confidence
Claude Opus 4.7 (Adaptive)69.4%61.0%estimated ± 6.3 pp, medium confidence
Claude Sonnet 4.550.0%43.7%estimated ± 6.3 pp, medium confidence
Composer 261.7%54.1%estimated ± 6.3 pp, medium confidence
GLM-4.741.0%35.7%estimated ± 6.3 pp, medium confidence
GLM-556.2%49.2%estimated ± 6.3 pp, medium confidence
GPT-5.3 Codex77.3%68.0%estimated ± 6.3 pp, medium confidence
GPT-5.475.1%66.0%estimated ± 6.3 pp, medium confidence
Hy3 Preview54.4%47.6%estimated ± 6.3 pp, medium confidence
Kimi K2.550.8%44.4%estimated ± 6.3 pp, medium confidence
Kimi K2.5 (Reasoning)50.8%44.4%estimated ± 6.3 pp, medium confidence
Laguna XS 2.137.5%32.6%estimated ± 6.3 pp, medium confidence
LongCat-Flash-Lite-Sparse33.7%29.2%estimated ± 6.3 pp, low confidence
MAI-Thinking-146.0%40.2%estimated ± 6.3 pp, medium confidence
Muse Spark59.0%51.7%estimated ± 6.3 pp, medium confidence
Qwen3.5-122B-A10B49.4%43.2%estimated ± 6.3 pp, medium confidence
Qwen3.5-27B41.6%36.2%estimated ± 6.3 pp, medium confidence
Qwen3.5-35B-A3B40.5%35.3%estimated ± 6.3 pp, medium confidence
Qwen3.5 397B52.5%45.9%estimated ± 6.3 pp, medium confidence
Qwen3.6-27B59.3%52.0%estimated ± 6.3 pp, medium confidence
Qwen3.6-35B-A3B51.5%45.0%estimated ± 6.3 pp, medium confidence
Qwen 3.6 Max (preview)65.4%57.4%estimated ± 6.3 pp, medium confidence