benchgap
Calibration

Terminal-Bench 4.0 → Terminal-Bench Science 0.1

Terminal-Bench Science 0.1 is estimated from Terminal-Bench 4.0 with a Hill curve fitted on 21 models measured on both: y = 0.0260 + (0.8189 − 0.0260)·x^6.00 / (0.51869^6.00 + x^6.00), R² = 0.95, cross-validated error 6.5 pp. It is used for 9 estimates.

Estimated modelTerminal-Bench 4.0Terminal-Bench Science 0.1Source
Claude Fable 5.1 (xhigh with fallback)55.1%49.4%estimated ± 6.5 pp, medium confidence
Kimi K3 (max)12.6%2.6%estimated ± 6.5 pp, medium confidence
K2 Horizon 375B A23B1.5%2.6%estimated ± 6.5 pp, medium confidence
Nemotron 3 Ultra0.5%2.6%estimated ± 6.5 pp, low confidence
Muse Glimmer (high)0.5%2.6%estimated ± 6.5 pp, low confidence
GPT-6 Astra (xhigh)59.6%57.9%estimated ± 6.5 pp, medium confidence
Gemini 4 Argon (high)57.1%53.4%estimated ± 6.5 pp, medium confidence
Mistral Large 4 Preview26.8%4.1%estimated ± 6.5 pp, medium confidence
Grok 4.7 (xhigh)25.8%3.8%estimated ± 6.5 pp, medium confidence