benchgap
Calibration

HMMT Feb 2026 → IMOAnswerBench

IMOAnswerBench is estimated from HMMT Feb 2026 with a Michaelis–Menten + offset curve fitted on 8 models measured on both: y = 0.0000 + 2.0000·x / (1.25219 + x), R² = 0.87, cross-validated error 5.9 pp. It is used for 15 estimates.

Estimated modelHMMT Feb 2026IMOAnswerBenchSource
Claude Opus 4.585.3%81.0%estimated ± 5.9 pp, medium confidence
GLM-586.4%81.7%estimated ± 5.9 pp, medium confidence
GLM-5.182.6%79.5%estimated ± 5.9 pp, medium confidence
GLM-5.292.5%85.0%estimated ± 5.9 pp, medium confidence
Inkling-Small90.2%83.7%estimated ± 5.9 pp, medium confidence
Kimi K2.692.7%85.1%estimated ± 5.9 pp, medium confidence
Kimi K2.587.1%82.0%estimated ± 5.9 pp, medium confidence
MAI-Thinking-184.9%80.8%estimated ± 5.9 pp, medium confidence
MiniCPM5-1B25.8%34.1%estimated ± 5.9 pp, low confidence
MiniCPM5-2B63.8%67.5%estimated ± 5.9 pp, medium confidence
Qwen3.5 397B87.9%82.5%estimated ± 5.9 pp, medium confidence
Qwen3.6-27B84.3%80.5%estimated ± 5.9 pp, medium confidence
Qwen3.6-35B-A3B83.6%80.1%estimated ± 5.9 pp, medium confidence
Qwen3.6 Plus87.8%82.4%estimated ± 5.9 pp, medium confidence
Solar Open 293.9%85.7%estimated ± 5.9 pp, medium confidence