benchgap
Anthropic · model

Claude Opus 5.5 (high with fallback) benchmark scores

As of 2026-10-07, Claude Opus 5.5 (high with fallback) (Anthropic) has measured scores on 5 benchmarks and estimated scores on 4 more.

BenchmarkScoreSource
Terminal-Bench 2.188.2%estimated ± 4.0 pp, high confidence
Terminal-Bench 4.056.6%measured
Terminal-Bench Science 0.149.0%measured
GPQA Diamond95.1%estimated ± 1.3 pp, high confidence
SciCode60.4%measured
CritPt30.0%estimated ± 3.5 pp, high confidence
GDP.pdf27.6%estimated ± 4.0 pp, high confidence
MMMU-Pro86.0%measured
Humanity's Last Exam55.6%measured