Calibration
MMMU-Pro → CharXiv
CharXiv is estimated from MMMU-Pro with a Hill curve fitted on 23 models measured on both: y = 0.0000 + (1.0036 − 0.0000)·x^6.00 / (0.61449^6.00 + x^6.00), R² = 0.67, cross-validated error 5.4 pp. It is used for 14 estimates.
| Estimated model | MMMU-Pro | CharXiv | Source |
|---|---|---|---|
| Gemma 4 26B A4B | 73.8% | 75.3% | estimated ± 5.4 pp, medium confidence |
| Gemma 4 31B | 76.9% | 79.6% | estimated ± 5.4 pp, medium confidence |
| GPT-5.4 mini | 76.6% | 79.2% | estimated ± 5.4 pp, medium confidence |
| GPT-5.4 nano | 66.1% | 61.0% | estimated ± 5.4 pp, medium confidence |
| GPT-5.5 | 81.2% | 84.5% | estimated ± 5.4 pp, medium confidence |
| GPT-5.6 Luna | 78.4% | 81.5% | estimated ± 5.4 pp, medium confidence |
| GPT-5.6 Sol | 83.0% | 86.2% | estimated ± 5.4 pp, medium confidence |
| GPT-5.6 Terra | 80.7% | 84.0% | estimated ± 5.4 pp, medium confidence |
| Grok 4.3 | 78.1% | 81.1% | estimated ± 5.4 pp, medium confidence |
| Interfaze Beta | 71.1% | 70.8% | estimated ± 5.4 pp, medium confidence |
| Kimi K2.5 | 78.5% | 81.6% | estimated ± 5.4 pp, medium confidence |
| Kimi K2.5 (Reasoning) | 78.5% | 81.6% | estimated ± 5.4 pp, medium confidence |
| Pareto 26.9 | 78.0% | 81.0% | estimated ± 5.4 pp, medium confidence |
| Step 5 Preview | 76.0% | 78.4% | estimated ± 5.4 pp, medium confidence |