benchgap
Anthropic · model

Claude Sonnet 5.5 (max with fallback) benchmark scores

As of 2026-10-07, Claude Sonnet 5.5 (max with fallback) (Anthropic) has measured scores on 9 benchmarks and estimated scores on 5 more.

BenchmarkScoreSource
Terminal-Bench 2.188.3%estimated ± 4.0 pp, medium confidence
Terminal-Bench 4.063.6%measured
Terminal-Bench Science 0.153.3%measured
GPQA Diamond95.0%estimated ± 1.3 pp, high confidence
SciCode61.0%measured
CritPt31.4%measured
GDP.pdf25.8%measured
τ³-Bench Banking48.3%estimated ± 4.5 pp, medium confidence
MMMU-Pro84.6%estimated ± 2.6 pp, high confidence
AA-AnalystAgent57.5%measured
Harvey LAB93.1%measured
Humanity's Last Exam55.0%measured
AutomationBench71.8%measured
EnterpriseOps-Gym55.4%estimated ± 1.8 pp, low confidence