benchgap
Anthropic · model

Claude Opus 5.5 (max with fallback) benchmark scores

As of 2026-10-07, Claude Opus 5.5 (max with fallback) (Anthropic) has measured scores on 11 benchmarks and estimated scores on 4 more.

BenchmarkScoreSource
Terminal-Bench 2.188.2%estimated ± 4.0 pp, medium confidence
Terminal-Bench 4.059.6%measured
Terminal-Bench Science 0.159.0%measured
GPQA Diamond96.0%estimated ± 1.3 pp, medium confidence
SciCode66.9%measured
CritPt31.7%measured
GDP.pdf26.2%measured
τ³-Bench Banking49.0%estimated ± 2.6 pp, medium confidence
MMMU-Pro88.0%measured
AA-AnalystAgent56.3%measured
Harvey LAB91.2%measured
Humanity's Last Exam61.4%measured
AutomationBench69.5%measured
EnterpriseOps-Gym54.8%estimated ± 1.8 pp, low confidence
ITBench SRE38.2%measured