benchgap
Other · model

SWE-2 benchmark scores

As of 2026-10-07, SWE-2 (Other) has measured scores on 4 benchmarks and estimated scores on 14 more.

BenchmarkScoreSource
AA-SciCode58.5%estimated ± 3.8 pp, medium confidence
Terminal-Bench 2.192.8%measured
AA Coding Index77.1%estimated ± 2.5 pp, high confidence
SWE-bench Verified91.8%estimated ± 0.8 pp, medium confidence
SWE-bench Pro76.6%estimated ± 7.5 pp, medium confidence
CursorBench 3.266.7%estimated ± 1.6 pp, medium confidence
Terminal-Bench 3.036.4%estimated ± 9.1 pp, low confidence
FrontierCode 1.1 Main50.0%measured
Vals LiveCodeBench88.1%estimated ± 1.9 pp, high confidence
Vals SWE-bench90.9%estimated ± 2.8 pp, high confidence
Terminal-Bench 2.1 (Vals AI)76.2%estimated ± 4.6 pp, medium confidence
AA Terminal-Bench 2.184.9%estimated ± 3.5 pp, medium confidence
AA Terminal-Bench 4.024.8%estimated ± 4.7 pp, high confidence
DeepSWE73.0%measured
PostTrainBench v1.141.6%estimated ± 4.8 pp, high confidence
Terminal-Bench 4.027.3%measured
Vibe Code Bench78.2%estimated ± 5.6 pp, low confidence
NL2Repo60.9%estimated ± 6.6 pp, medium confidence