benchgap
Other · model

Ember-1 benchmark scores

As of 2026-10-07, Ember-1 (Other) has measured scores on 3 benchmarks and estimated scores on 18 more.

BenchmarkScoreSource
AA-SciCode53.6%estimated ± 3.9 pp, high confidence
LiveCodeBench v687.1%estimated ± 8.1 pp, low confidence
SciCode53.9%estimated ± 3.8 pp, medium confidence
Terminal-Bench 2.182.0%measured
AA Coding Index77.8%estimated ± 2.5 pp, high confidence
SWE-bench Verified92.2%measured
SWE-bench Pro74.7%estimated ± 3.2 pp, high confidence
CursorBench 3.268.2%estimated ± 6.4 pp, low confidence
Terminal-Bench 3.015.1%estimated ± 9.1 pp, low confidence
FrontierCode 1.1 Main51.6%estimated ± 2.7 pp, medium confidence
Vals LiveCodeBench91.8%estimated ± 9.9 pp, low confidence
Vals SWE-bench93.1%estimated ± 6.8 pp, medium confidence
Terminal-Bench 2.1 (Vals AI)69.3%estimated ± 7.4 pp, medium confidence
AA Terminal-Bench 2.184.8%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.021.0%estimated ± 8.9 pp, medium confidence
DeepSWE75.2%measured
PostTrainBench v1.143.7%estimated ± 4.8 pp, high confidence
Vibe Code Bench62.5%estimated ± 8.1 pp, low confidence
NL2Repo71.2%estimated ± 6.1 pp, low confidence
SWE-Rebench61.8%estimated ± 3.6 pp, low confidence
LiveCodeBench93.5%estimated ± 10.2 pp, low confidence