benchgap
Calibration

AA Terminal-Bench 4.0 → Terminal-Bench 2.1 (Vals AI)

Terminal-Bench 2.1 (Vals AI) is estimated from AA Terminal-Bench 4.0 with a Michaelis–Menten + offset curve fitted on 13 models measured on both: y = 0.4501 + 0.3760·x / (0.06110 + x), R² = 0.73, cross-validated error 8.5 pp. It is used for 4 estimates.

Estimated modelAA Terminal-Bench 4.0Terminal-Bench 2.1 (Vals AI)Source
GPT-6.1 Sol56.1%78.9%estimated ± 8.5 pp, medium confidence
GPT-6 Luna12.6%70.3%estimated ± 8.5 pp, medium confidence
GPT-6 Sol43.9%78.0%estimated ± 8.5 pp, medium confidence
Mistral Large 426.8%75.6%estimated ± 8.5 pp, medium confidence