Other · model
SWE-1.7 benchmark scores
As of 2026-10-07, SWE-1.7 (Other) has measured scores on 3 benchmarks and estimated scores on 16 more.
| Benchmark | Score | Source |
|---|---|---|
| AA-SciCode | 56.0% | estimated ± 3.8 pp, medium confidence |
| Terminal-Bench 2.1 | 81.5% | measured |
| AA Coding Index | 73.5% | estimated ± 3.3 pp, high confidence |
| SWE-bench Verified | 85.3% | estimated ± 0.8 pp, medium confidence |
| SWE-bench Pro | 68.8% | estimated ± 7.5 pp, medium confidence |
| CursorBench 3.2 | 59.4% | estimated ± 1.6 pp, low confidence |
| Terminal-Bench 3.0 | 14.6% | estimated ± 9.1 pp, low confidence |
| FrontierCode 1.1 Main | 42.3% | measured |
| Vals LiveCodeBench | 86.0% | estimated ± 1.9 pp, high confidence |
| Vals SWE-bench | 82.3% | estimated ± 2.8 pp, high confidence |
| Terminal-Bench 2.1 (Vals AI) | 68.9% | estimated ± 7.4 pp, medium confidence |
| AA Terminal-Bench 2.1 | 84.7% | estimated ± 3.5 pp, high confidence |
| AA Terminal-Bench 4.0 | 20.4% | estimated ± 8.9 pp, medium confidence |
| DeepSWE | 65.2% | estimated ± 3.4 pp, low confidence |
| PostTrainBench v1.1 | 28.8% | estimated ± 5.9 pp, low confidence |
| SWE Multilingual | 77.8% | measured |
| Vibe Code Bench | 71.4% | estimated ± 5.6 pp, low confidence |
| MMLU-ProX | 85.8% | estimated ± 1.7 pp, medium confidence |
| NOVA-63 | 58.3% | estimated ± 1.6 pp, low confidence |