benchgap
Anthropic · model

Claude Opus 5.5 (xhigh with fallback) benchmark scores

As of 2026-10-07, Claude Opus 5.5 (xhigh with fallback) (Anthropic) has measured scores on 6 benchmarks and estimated scores on 3 more.

BenchmarkScoreSource
Terminal-Bench 2.188.2%estimated ± 4.0 pp, medium confidence
Terminal-Bench 4.059.6%measured
Terminal-Bench Science 0.161.9%measured
GPQA Diamond95.4%estimated ± 1.3 pp, high confidence
SciCode65.0%measured
CritPt31.7%measured
GDP.pdf29.1%estimated ± 4.0 pp, high confidence
MMMU-Pro87.0%measured
Humanity's Last Exam57.5%measured