benchgap
Calibration

MMMU-Pro → SimpleVQA

SimpleVQA is estimated from MMMU-Pro with a Michaelis–Menten curve fitted on 10 models measured on both: y = 2.0000·x / (1.54927 + x), R² = 0.66, cross-validated error 8.2 pp. It is used for 16 estimates.

Estimated modelMMMU-ProSimpleVQASource
Gemma 4 12B69.1%61.7%estimated ± 8.2 pp, medium confidence
Gemma 4 26B A4B73.8%64.5%estimated ± 8.2 pp, medium confidence
Gemma 4 31B76.9%66.3%estimated ± 8.2 pp, medium confidence
GPT-5.4 mini76.6%66.2%estimated ± 8.2 pp, medium confidence
GPT-5.4 nano66.1%59.8%estimated ± 8.2 pp, medium confidence
GPT-5.581.2%68.8%estimated ± 8.2 pp, medium confidence
GPT-5.6 Luna78.4%67.2%estimated ± 8.2 pp, medium confidence
GPT-5.6 Sol83.0%69.8%estimated ± 8.2 pp, medium confidence
GPT-5.6 Terra80.7%68.5%estimated ± 8.2 pp, medium confidence
Grok 4.378.1%67.0%estimated ± 8.2 pp, medium confidence
Interfaze Beta71.1%62.9%estimated ± 8.2 pp, medium confidence
Kimi K2.578.5%67.3%estimated ± 8.2 pp, medium confidence
Kimi K2.5 (Reasoning)78.5%67.3%estimated ± 8.2 pp, medium confidence
MiniMax M378.1%67.0%estimated ± 8.2 pp, medium confidence
Pareto 26.978.0%67.0%estimated ± 8.2 pp, medium confidence
Step 5 Preview76.0%65.8%estimated ± 8.2 pp, medium confidence