benchgap
Calibration

ARC-AGI-3 → HealthBench (length-adjusted)

HealthBench (length-adjusted) is estimated from ARC-AGI-3 with a Hill curve fitted on 5 models measured on both: y = 0.5385 + (0.5842 − 0.5385)·x^6.00 / (0.22103^6.00 + x^6.00), R² = 0.96, cross-validated error 0.9 pp. It is used for 12 estimates.

Estimated modelARC-AGI-3HealthBench (length-adjusted)Source
Claude Opus 4.7 (Adaptive)0.2%53.8%estimated ± 0.9 pp, medium confidence
Claude Opus 4.81.5%53.8%estimated ± 0.9 pp, medium confidence
Gemini 3.1 Pro0.4%53.8%estimated ± 0.9 pp, medium confidence
Gemini 3.8 Flash10.4%53.9%estimated ± 0.9 pp, medium confidence
GPT-5.40.2%53.8%estimated ± 0.9 pp, medium confidence
GPT-5.50.4%53.8%estimated ± 0.9 pp, medium confidence
GPT-5.6 Luna0.2%53.8%estimated ± 0.9 pp, medium confidence
GPT-5.6 Sol7.8%53.9%estimated ± 0.9 pp, medium confidence
GPT-5.6 Terra0.8%53.8%estimated ± 0.9 pp, medium confidence
Grok 4.200.1%53.8%estimated ± 0.9 pp, low confidence
Grok 4.50.3%53.8%estimated ± 0.9 pp, medium confidence
Grok 4.62.1%53.8%estimated ± 0.9 pp, medium confidence