Calibration
AA Terminal-Bench 4.0 → Terminal-Bench 2.1 (Vals AI)
Terminal-Bench 2.1 (Vals AI) is estimated from AA Terminal-Bench 4.0 with a Michaelis–Menten + offset curve fitted on 13 models measured on both: y = 0.4501 + 0.3760·x / (0.06110 + x), R² = 0.73, cross-validated error 8.5 pp. It is used for 4 estimates.
| Estimated model | AA Terminal-Bench 4.0 | Terminal-Bench 2.1 (Vals AI) | Source |
|---|---|---|---|
| GPT-6.1 Sol | 56.1% | 78.9% | estimated ± 8.5 pp, medium confidence |
| GPT-6 Luna | 12.6% | 70.3% | estimated ± 8.5 pp, medium confidence |
| GPT-6 Sol | 43.9% | 78.0% | estimated ± 8.5 pp, medium confidence |
| Mistral Large 4 | 26.8% | 75.6% | estimated ± 8.5 pp, medium confidence |