benchgap
Anthropic · model

Claude Haiku 4.5 Thinking benchmark scores

As of 2026-10-07, Claude Haiku 4.5 Thinking (Anthropic) has measured scores on 1 benchmark and estimated scores on 8 more.

BenchmarkScoreSource
AA-SciCode47.4%estimated ± 3.8 pp, high confidence
AA Coding Index44.9%estimated ± 6.8 pp, medium confidence
SWE-bench Verified73.8%estimated ± 4.4 pp, high confidence
FrontierCode 1.1 Main4.5%estimated ± 4.3 pp, low confidence
Vals SWE-bench68.5%estimated ± 6.3 pp, medium confidence
PostTrainBench v1.119.9%estimated ± 10.5 pp, low confidence
Vibe Code Bench11.4%measured
React Native Evals57.0%estimated ± 3.0 pp, low confidence
SWE-Rebench2.2%estimated ± 6.5 pp, low confidence