Calibration
MMMU-Pro → SimpleVQA
SimpleVQA is estimated from MMMU-Pro with a Michaelis–Menten curve fitted on 10 models measured on both: y = 2.0000·x / (1.54927 + x), R² = 0.66, cross-validated error 8.2 pp. It is used for 16 estimates.
| Estimated model | MMMU-Pro | SimpleVQA | Source |
|---|---|---|---|
| Gemma 4 12B | 69.1% | 61.7% | estimated ± 8.2 pp, medium confidence |
| Gemma 4 26B A4B | 73.8% | 64.5% | estimated ± 8.2 pp, medium confidence |
| Gemma 4 31B | 76.9% | 66.3% | estimated ± 8.2 pp, medium confidence |
| GPT-5.4 mini | 76.6% | 66.2% | estimated ± 8.2 pp, medium confidence |
| GPT-5.4 nano | 66.1% | 59.8% | estimated ± 8.2 pp, medium confidence |
| GPT-5.5 | 81.2% | 68.8% | estimated ± 8.2 pp, medium confidence |
| GPT-5.6 Luna | 78.4% | 67.2% | estimated ± 8.2 pp, medium confidence |
| GPT-5.6 Sol | 83.0% | 69.8% | estimated ± 8.2 pp, medium confidence |
| GPT-5.6 Terra | 80.7% | 68.5% | estimated ± 8.2 pp, medium confidence |
| Grok 4.3 | 78.1% | 67.0% | estimated ± 8.2 pp, medium confidence |
| Interfaze Beta | 71.1% | 62.9% | estimated ± 8.2 pp, medium confidence |
| Kimi K2.5 | 78.5% | 67.3% | estimated ± 8.2 pp, medium confidence |
| Kimi K2.5 (Reasoning) | 78.5% | 67.3% | estimated ± 8.2 pp, medium confidence |
| MiniMax M3 | 78.1% | 67.0% | estimated ± 8.2 pp, medium confidence |
| Pareto 26.9 | 78.0% | 67.0% | estimated ± 8.2 pp, medium confidence |
| Step 5 Preview | 76.0% | 65.8% | estimated ± 8.2 pp, medium confidence |