benchgap
Calibration

MMMU-Pro → CharXiv

CharXiv is estimated from MMMU-Pro with a Hill curve fitted on 23 models measured on both: y = 0.0000 + (1.0036 − 0.0000)·x^6.00 / (0.61449^6.00 + x^6.00), R² = 0.67, cross-validated error 5.4 pp. It is used for 14 estimates.

Estimated modelMMMU-ProCharXivSource
Gemma 4 26B A4B73.8%75.3%estimated ± 5.4 pp, medium confidence
Gemma 4 31B76.9%79.6%estimated ± 5.4 pp, medium confidence
GPT-5.4 mini76.6%79.2%estimated ± 5.4 pp, medium confidence
GPT-5.4 nano66.1%61.0%estimated ± 5.4 pp, medium confidence
GPT-5.581.2%84.5%estimated ± 5.4 pp, medium confidence
GPT-5.6 Luna78.4%81.5%estimated ± 5.4 pp, medium confidence
GPT-5.6 Sol83.0%86.2%estimated ± 5.4 pp, medium confidence
GPT-5.6 Terra80.7%84.0%estimated ± 5.4 pp, medium confidence
Grok 4.378.1%81.1%estimated ± 5.4 pp, medium confidence
Interfaze Beta71.1%70.8%estimated ± 5.4 pp, medium confidence
Kimi K2.578.5%81.6%estimated ± 5.4 pp, medium confidence
Kimi K2.5 (Reasoning)78.5%81.6%estimated ± 5.4 pp, medium confidence
Pareto 26.978.0%81.0%estimated ± 5.4 pp, medium confidence
Step 5 Preview76.0%78.4%estimated ± 5.4 pp, medium confidence