benchgap
Calibration

FrontierCode 1.1 Main → SWE-bench Verified

SWE-bench Verified is estimated from FrontierCode 1.1 Main with a Hill curve fitted on 6 models measured on both: y = 0.7982 + (1.2000 − 0.7982)·x^6.00 / (0.57625^6.00 + x^6.00), R² = 0.99, cross-validated error 0.8 pp. It is used for 10 estimates.

Estimated modelFrontierCode 1.1 MainSWE-bench VerifiedSource
Claude Haiku 5.546.4%88.4%estimated ± 0.8 pp, medium confidence
Claude Opus 4.738.5%83.1%estimated ± 0.8 pp, medium confidence
Claude Opus 5.554.4%96.5%estimated ± 0.8 pp, low confidence
Claude Sonnet 5.546.2%88.3%estimated ± 0.8 pp, medium confidence
Gemini 3.7 Flash43.6%86.2%estimated ± 0.8 pp, medium confidence
GPT-5.4 mini27.0%80.2%estimated ± 0.8 pp, medium confidence
GPT-5.543.0%85.7%estimated ± 0.8 pp, medium confidence
GPT-6 Astra53.3%95.3%estimated ± 0.8 pp, medium confidence
SWE-1.742.3%85.3%estimated ± 0.8 pp, medium confidence
SWE-250.0%91.8%estimated ± 0.8 pp, medium confidence