benchgap
Calibration

AA-GPQA Diamond → MMLU-Pro

MMLU-Pro is estimated from AA-GPQA Diamond with a linear curve fitted on 36 models measured on both: y = 0.4381·x + 0.4821, R² = 0.73, cross-validated error 3.9 pp. It is used for 11 estimates.

Estimated modelAA-GPQA DiamondMMLU-ProSource
Claude 3 Opus48.9%69.6%estimated ± 3.9 pp, high confidence
Claude 4.1 Opus Thinking80.9%83.7%estimated ± 3.9 pp, high confidence
DeepSeek R1 Distill Qwen 32B61.5%75.2%estimated ± 3.9 pp, high confidence
Gemini 1.0 Pro27.7%60.3%estimated ± 3.9 pp, medium confidence
Gemini 1.5 Pro58.9%74.0%estimated ± 3.9 pp, high confidence
GLM-5.3-Flash91.2%88.2%estimated ± 3.9 pp, high confidence
GPT-4o mini42.6%66.9%estimated ± 3.9 pp, medium confidence
o1-preview76.5%81.7%estimated ± 3.9 pp, high confidence
o3-pro84.5%85.2%estimated ± 3.9 pp, high confidence
Phi-4 Multimodal Instruct31.5%62.0%estimated ± 3.9 pp, medium confidence
Qwen2.5 Coder 32B Instruct41.7%66.5%estimated ± 3.9 pp, medium confidence