benchgap
Calibration

NL2Repo → SWE-bench Verified

SWE-bench Verified is estimated from NL2Repo with a Michaelis–Menten curve fitted on 15 models measured on both: y = 0.9719·x / (0.10189 + x), R² = 0.77, cross-validated error 2.4 pp. It is used for 14 estimates.

Estimated modelNL2RepoSWE-bench VerifiedSource
DeepSeek V4.1 Flash65.4%84.1%estimated ± 2.4 pp, medium confidence
GLM-5.142.7%78.5%estimated ± 2.4 pp, high confidence
GLM-5.248.9%80.4%estimated ± 2.4 pp, high confidence
GLM-5.358.0%82.7%estimated ± 2.4 pp, high confidence
GLM-5.3-Flash56.3%82.3%estimated ± 2.4 pp, high confidence
Hy4 preview58.9%82.9%estimated ± 2.4 pp, high confidence
MiniMax M2.739.8%77.4%estimated ± 2.4 pp, high confidence
Qwen 3.6 Max (preview)42.9%78.5%estimated ± 2.4 pp, high confidence
Qwen3.8-27B42.3%78.3%estimated ± 2.4 pp, high confidence
Qwen3.8-Flash-Next48.1%80.2%estimated ± 2.4 pp, high confidence
Qwen3.8 Max55.9%82.2%estimated ± 2.4 pp, high confidence
Qwen3.8-Omni-Flash48.9%80.4%estimated ± 2.4 pp, high confidence
Seed 2.1 Pro47.0%79.9%estimated ± 2.4 pp, high confidence
Seed 2.1 Turbo43.7%78.8%estimated ± 2.4 pp, high confidence