Calibration
Vals MMLU-Pro → HealthBench Professional
HealthBench Professional is estimated from Vals MMLU-Pro with a offset logistic curve fitted on 5 models measured on both: y = 0.4983 + (0.5999 − 0.4983) / (1 + exp(−130.12·(x − 0.8576))), R² = 0.95, cross-validated error 1.3 pp. It is used for 51 estimates.
| Estimated model | Vals MMLU-Pro | HealthBench Professional | Source |
|---|---|---|---|
| Claude Fable 5 | 91.5% | 60.0% | estimated ± 1.3 pp, medium confidence |
| Claude Fable 5.1 | 92.4% | 60.0% | estimated ± 1.3 pp, low confidence |
| Claude Haiku 4.5 | 78.7% | 49.8% | estimated ± 1.3 pp, low confidence |
| Claude Opus 4.7 | 89.9% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Claude Opus 4.8 | 89.6% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Claude Sonnet 4.6 | 87.3% | 58.8% | estimated ± 1.3 pp, medium confidence |
| Claude Sonnet 5 | 87.5% | 59.0% | estimated ± 1.3 pp, medium confidence |
| DeepSeek V4 Flash 0731 | 86.2% | 56.3% | estimated ± 1.3 pp, medium confidence |
| DeepSeek V4 Pro 0813 | 87.0% | 58.3% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.1 Flash-Lite | 86.2% | 56.3% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.1 Pro | 91.0% | 60.0% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.5 Flash | 89.5% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.5 Flash-Lite | 85.8% | 55.0% | estimated ± 1.3 pp, low confidence |
| Gemini 3.6 Flash | 89.3% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.7 Flash | 90.1% | 60.0% | estimated ± 1.3 pp, medium confidence |
| Gemini 3.8 Flash | 90.2% | 60.0% | estimated ± 1.3 pp, medium confidence |
| Gemini 3 Flash | 88.6% | 59.7% | estimated ± 1.3 pp, medium confidence |
| GLM-4.5 | 81.2% | 49.9% | estimated ± 1.3 pp, low confidence |
| GLM-4.6 | 82.2% | 49.9% | estimated ± 1.3 pp, low confidence |
| GLM-4.7 | 82.7% | 50.0% | estimated ± 1.3 pp, low confidence |
| GLM-5.1 | 86.9% | 58.1% | estimated ± 1.3 pp, medium confidence |
| GLM-5.2 | 86.7% | 57.7% | estimated ± 1.3 pp, medium confidence |
| GLM-5.3 | 86.8% | 57.9% | estimated ± 1.3 pp, medium confidence |
| GLM-5.3-Flash | 86.1% | 56.0% | estimated ± 1.3 pp, medium confidence |
| GPT-5.4 mini | 84.6% | 51.7% | estimated ± 1.3 pp, low confidence |
| GPT-5.4 nano | 77.2% | 49.8% | estimated ± 1.3 pp, low confidence |
| GPT-5.5 | 88.1% | 59.5% | estimated ± 1.3 pp, medium confidence |
| Grok 4.20 | 86.3% | 56.6% | estimated ± 1.3 pp, medium confidence |
| Grok 4.3 | 85.8% | 55.0% | estimated ± 1.3 pp, low confidence |
| Grok 4.5 | 89.2% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Grok 4.6 | 89.4% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Inkling | 86.3% | 56.6% | estimated ± 1.3 pp, medium confidence |
| Inkling-Small | 85.6% | 54.4% | estimated ± 1.3 pp, low confidence |
| Kimi K2.6 | 87.6% | 59.1% | estimated ± 1.3 pp, medium confidence |
| Kimi K3 | 88.0% | 59.5% | estimated ± 1.3 pp, medium confidence |
| Laguna M.1 | 68.8% | 49.8% | estimated ± 1.3 pp, low confidence |
| Laguna XS.2 | 69.1% | 49.8% | estimated ± 1.3 pp, low confidence |
| Ling 3.0 Flash | 82.0% | 49.9% | estimated ± 1.3 pp, low confidence |
| MiMo-V2.5 | 82.9% | 50.1% | estimated ± 1.3 pp, low confidence |
| MiMo-V2.5-Pro | 84.6% | 51.7% | estimated ± 1.3 pp, low confidence |
| MiniMax M2.7 | 80.4% | 49.8% | estimated ± 1.3 pp, low confidence |
| MiniMax M3 | 84.2% | 51.0% | estimated ± 1.3 pp, low confidence |
| Mistral Medium 3.5 128B | 75.3% | 49.8% | estimated ± 1.3 pp, low confidence |
| Muse Spark | 87.3% | 58.8% | estimated ± 1.3 pp, medium confidence |
| Muse Spark 1.2 | 88.3% | 59.6% | estimated ± 1.3 pp, medium confidence |
| Nemotron 3 Ultra | 85.8% | 55.0% | estimated ± 1.3 pp, low confidence |
| Qwen3.5 Flash | 84.1% | 50.9% | estimated ± 1.3 pp, low confidence |
| Qwen3.6 Plus | 87.7% | 59.2% | estimated ± 1.3 pp, medium confidence |
| Qwen3.7 Max | 89.3% | 59.9% | estimated ± 1.3 pp, medium confidence |
| Qwen3.8-27B | 84.3% | 51.2% | estimated ± 1.3 pp, low confidence |
| Qwen3.8 Max | 88.6% | 59.7% | estimated ± 1.3 pp, medium confidence |