benchgap
Other · model

SWE-1.7 benchmark scores

As of 2026-10-07, SWE-1.7 (Other) has measured scores on 3 benchmarks and estimated scores on 16 more.

BenchmarkScoreSource
AA-SciCode56.0%estimated ± 3.8 pp, medium confidence
Terminal-Bench 2.181.5%measured
AA Coding Index73.5%estimated ± 3.3 pp, high confidence
SWE-bench Verified85.3%estimated ± 0.8 pp, medium confidence
SWE-bench Pro68.8%estimated ± 7.5 pp, medium confidence
CursorBench 3.259.4%estimated ± 1.6 pp, low confidence
Terminal-Bench 3.014.6%estimated ± 9.1 pp, low confidence
FrontierCode 1.1 Main42.3%measured
Vals LiveCodeBench86.0%estimated ± 1.9 pp, high confidence
Vals SWE-bench82.3%estimated ± 2.8 pp, high confidence
Terminal-Bench 2.1 (Vals AI)68.9%estimated ± 7.4 pp, medium confidence
AA Terminal-Bench 2.184.7%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.020.4%estimated ± 8.9 pp, medium confidence
DeepSWE65.2%estimated ± 3.4 pp, low confidence
PostTrainBench v1.128.8%estimated ± 5.9 pp, low confidence
SWE Multilingual77.8%measured
Vibe Code Bench71.4%estimated ± 5.6 pp, low confidence
MMLU-ProX85.8%estimated ± 1.7 pp, medium confidence
NOVA-6358.3%estimated ± 1.6 pp, low confidence