Calibration
Terminal-Bench 4.0 → Terminal-Bench Science 0.1
Terminal-Bench Science 0.1 is estimated from Terminal-Bench 4.0 with a Hill curve fitted on 21 models measured on both: y = 0.0260 + (0.8189 − 0.0260)·x^6.00 / (0.51869^6.00 + x^6.00), R² = 0.95, cross-validated error 6.5 pp. It is used for 9 estimates.
| Estimated model | Terminal-Bench 4.0 | Terminal-Bench Science 0.1 | Source |
|---|---|---|---|
| Claude Fable 5.1 (xhigh with fallback) | 55.1% | 49.4% | estimated ± 6.5 pp, medium confidence |
| Kimi K3 (max) | 12.6% | 2.6% | estimated ± 6.5 pp, medium confidence |
| K2 Horizon 375B A23B | 1.5% | 2.6% | estimated ± 6.5 pp, medium confidence |
| Nemotron 3 Ultra | 0.5% | 2.6% | estimated ± 6.5 pp, low confidence |
| Muse Glimmer (high) | 0.5% | 2.6% | estimated ± 6.5 pp, low confidence |
| GPT-6 Astra (xhigh) | 59.6% | 57.9% | estimated ± 6.5 pp, medium confidence |
| Gemini 4 Argon (high) | 57.1% | 53.4% | estimated ± 6.5 pp, medium confidence |
| Mistral Large 4 Preview | 26.8% | 4.1% | estimated ± 6.5 pp, medium confidence |
| Grok 4.7 (xhigh) | 25.8% | 3.8% | estimated ± 6.5 pp, medium confidence |