Calibration
FrontierCode 1.1 Main → SWE-bench Verified
SWE-bench Verified is estimated from FrontierCode 1.1 Main with a Hill curve fitted on 6 models measured on both: y = 0.7982 + (1.2000 − 0.7982)·x^6.00 / (0.57625^6.00 + x^6.00), R² = 0.99, cross-validated error 0.8 pp. It is used for 10 estimates.
| Estimated model | FrontierCode 1.1 Main | SWE-bench Verified | Source |
|---|---|---|---|
| Claude Haiku 5.5 | 46.4% | 88.4% | estimated ± 0.8 pp, medium confidence |
| Claude Opus 4.7 | 38.5% | 83.1% | estimated ± 0.8 pp, medium confidence |
| Claude Opus 5.5 | 54.4% | 96.5% | estimated ± 0.8 pp, low confidence |
| Claude Sonnet 5.5 | 46.2% | 88.3% | estimated ± 0.8 pp, medium confidence |
| Gemini 3.7 Flash | 43.6% | 86.2% | estimated ± 0.8 pp, medium confidence |
| GPT-5.4 mini | 27.0% | 80.2% | estimated ± 0.8 pp, medium confidence |
| GPT-5.5 | 43.0% | 85.7% | estimated ± 0.8 pp, medium confidence |
| GPT-6 Astra | 53.3% | 95.3% | estimated ± 0.8 pp, medium confidence |
| SWE-1.7 | 42.3% | 85.3% | estimated ± 0.8 pp, medium confidence |
| SWE-2 | 50.0% | 91.8% | estimated ± 0.8 pp, medium confidence |