benchgap
Other · model

Composer 2.5 benchmark scores

As of 2026-10-07, Composer 2.5 (Other) has measured scores on 7 benchmarks and estimated scores on 22 more.

BenchmarkScoreSource
AA-SciCode57.6%estimated ± 1.7 pp, medium confidence
SciCode51.1%estimated ± 4.5 pp, medium confidence
Terminal-Bench 2.175.9%estimated ± 6.9 pp, medium confidence
AA Coding Index65.9%estimated ± 1.0 pp, medium confidence
SWE-bench Verified81.4%estimated ± 4.5 pp, high confidence
SWE-bench Pro52.4%estimated ± 4.3 pp, medium confidence
CursorBench 3.163.2%measured
CursorBench 3.256.1%measured
Terminal-Bench 3.04.9%estimated ± 6.9 pp, low confidence
FrontierCode 1.1 Main38.9%estimated ± 1.6 pp, low confidence
FrontierSWE v23.5%estimated ± 7.6 pp, low confidence
Vals LiveCodeBench78.7%estimated ± 2.7 pp, low confidence
Vals SWE-bench79.6%measured
Terminal-Bench 2.1 (Vals AI)58.4%measured
VulcanBench v370.0%estimated ± 0.7 pp, low confidence
AA Terminal-Bench 2.174.6%estimated ± 4.4 pp, high confidence
AA Terminal-Bench 4.011.9%estimated ± 14.0 pp, low confidence
CursorBench 4.027.7%measured
DeepSWE56.3%estimated ± 7.2 pp, low confidence
PostTrainBench v1.125.2%estimated ± 3.3 pp, high confidence
ProgramBench68.1%estimated ± 6.0 pp, low confidence
SWE Multilingual79.8%measured
MMLU-ProX86.6%estimated ± 1.7 pp, low confidence
NL2Repo45.6%estimated ± 4.7 pp, high confidence
NOVA-6359.2%estimated ± 1.6 pp, low confidence
Terminal-Bench 2.069.3%measured
React Native Evals80.6%estimated ± 2.4 pp, medium confidence
FrontierCode 1.1 Extended55.1%estimated ± 1.6 pp, low confidence
OpenHarmony Bench54.2%estimated ± 3.2 pp, high confidence