benchgap
Calibration

FrontierCode 1.1 Extended → Vals SWE-bench

Vals SWE-bench is estimated from FrontierCode 1.1 Extended with a Michaelis–Menten curve fitted on 5 models measured on both: y = 1.2085·x / (0.15744 + x), R² = 0.70, cross-validated error 1.4 pp. It is used for 3 estimates.

Estimated modelFrontierCode 1.1 ExtendedVals SWE-benchSource
Claude Opus 5.563.6%96.9%estimated ± 1.4 pp, medium confidence
Claude Sonnet 5.559.1%95.4%estimated ± 1.4 pp, medium confidence
GPT-6 Astra64.5%97.1%estimated ± 1.4 pp, low confidence