benchgap
Anthropic · model

Claude Opus 5.5 (medium with fallback) benchmark scores

As of 2026-10-07, Claude Opus 5.5 (medium with fallback) (Anthropic) has measured scores on 2 benchmarks and estimated scores on 3 more.

BenchmarkScoreSource
Terminal-Bench 2.189.4%estimated ± 7.0 pp, medium confidence
Terminal-Bench 4.053.6%estimated ± 8.2 pp, medium confidence
Terminal-Bench Science 0.143.3%measured
GDP.pdf27.6%estimated ± 4.0 pp, high confidence
MMMU-Pro86.0%measured