Calibration
MMMU-Pro → MedXpertQA (MM)
MedXpertQA (MM) is estimated from MMMU-Pro with a Hill curve fitted on 8 models measured on both: y = 0.0007 + (1.2000 − 0.0007)·x^6.00 / (0.73672^6.00 + x^6.00), R² = 0.96, cross-validated error 2.4 pp. It is used for 34 estimates.
| Estimated model | MMMU-Pro | MedXpertQA (MM) | Source |
|---|---|---|---|
| Claude Opus 4.5 | 70.6% | 52.4% | estimated ± 2.4 pp, high confidence |
| Command A+ | 63.0% | 33.8% | estimated ± 2.4 pp, medium confidence |
| dots3-note Preview | 79.1% | 72.6% | estimated ± 2.4 pp, high confidence |
| Gemini 3.5 Flash | 83.6% | 81.7% | estimated ± 2.4 pp, high confidence |
| Gemini 3 Pro | 81.0% | 76.6% | estimated ± 2.4 pp, high confidence |
| Gemma 4 26B A4B | 73.8% | 60.3% | estimated ± 2.4 pp, high confidence |
| Gemma 4 31B | 76.9% | 67.7% | estimated ± 2.4 pp, high confidence |
| GPT-5.2 | 79.5% | 73.5% | estimated ± 2.4 pp, high confidence |
| GPT-5.4 mini | 76.6% | 67.0% | estimated ± 2.4 pp, high confidence |
| GPT-5.4 nano | 66.1% | 41.2% | estimated ± 2.4 pp, medium confidence |
| GPT-5.5 | 81.2% | 77.1% | estimated ± 2.4 pp, high confidence |
| GPT-5.6 Luna | 78.4% | 71.1% | estimated ± 2.4 pp, high confidence |
| GPT-5.6 Sol | 83.0% | 80.6% | estimated ± 2.4 pp, high confidence |
| GPT-5.6 Terra | 80.7% | 76.0% | estimated ± 2.4 pp, high confidence |
| Grok 4.3 | 78.1% | 70.4% | estimated ± 2.4 pp, high confidence |
| Inkling | 73.5% | 59.6% | estimated ± 2.4 pp, high confidence |
| Inkling-Small | 74.0% | 60.8% | estimated ± 2.4 pp, high confidence |
| Interfaze Beta | 71.1% | 53.7% | estimated ± 2.4 pp, high confidence |
| Kimi K2.6 | 79.4% | 73.3% | estimated ± 2.4 pp, high confidence |
| Kimi K2.5 | 78.5% | 71.3% | estimated ± 2.4 pp, high confidence |
| Kimi K2.5 (Reasoning) | 78.5% | 71.3% | estimated ± 2.4 pp, high confidence |
| Kimi K3 | 81.6% | 77.9% | estimated ± 2.4 pp, high confidence |
| LFM2.5-VL-3B | 30.5% | 0.7% | estimated ± 2.4 pp, medium confidence |
| MiMo-V2.5 | 77.9% | 70.0% | estimated ± 2.4 pp, high confidence |
| MiniMax M3 | 78.1% | 70.4% | estimated ± 2.4 pp, high confidence |
| Muse Glimmer 30B | 74.0% | 60.8% | estimated ± 2.4 pp, high confidence |
| Pareto 26.9 | 78.0% | 70.2% | estimated ± 2.4 pp, high confidence |
| Qwen3.5 397B | 79.0% | 72.4% | estimated ± 2.4 pp, high confidence |
| Qwen3.6-27B | 75.8% | 65.1% | estimated ± 2.4 pp, high confidence |
| Qwen3.6-35B-A3B | 75.3% | 64.0% | estimated ± 2.4 pp, high confidence |
| Qwen3.6 Plus | 78.8% | 72.0% | estimated ± 2.4 pp, high confidence |
| Seed 2.1 Pro | 81.6% | 77.9% | estimated ± 2.4 pp, high confidence |
| Seed 2.1 Turbo | 80.1% | 74.8% | estimated ± 2.4 pp, high confidence |
| Step 5 Preview | 76.0% | 65.6% | estimated ± 2.4 pp, high confidence |