benchgap
Math

IMOAnswerBench leaderboard

As of 2026-10-07, the highest measured score on IMOAnswerBench is 90.9% by dots3-note Preview. 15 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1dots3-note Preview90.9%measured
2Qwen3.7 Max90.0%measured
3DeepSeek V4 Pro 081389.8%measured
4DeepSeek V4 Flash 073188.4%measured
5Qwen3.7 Plus86.0%measured
6Solar Open 285.7%estimated ± 5.9 pp, medium confidence
7Kimi K2.685.1%estimated ± 5.9 pp, medium confidence
8GLM-5.285.0%estimated ± 5.9 pp, medium confidence
9Inkling-Small83.7%estimated ± 5.9 pp, medium confidence
10Ling 3.0 Flash83.7%measured
11Qwen3.5 397B82.5%estimated ± 5.9 pp, medium confidence
12Qwen3.6 Plus82.4%estimated ± 5.9 pp, medium confidence
13Kimi K2.582.0%estimated ± 5.9 pp, medium confidence
14GLM-581.7%estimated ± 5.9 pp, medium confidence
15Claude Opus 4.581.0%estimated ± 5.9 pp, medium confidence
16MAI-Thinking-180.8%estimated ± 5.9 pp, medium confidence
17Qwen3.6-27B80.5%estimated ± 5.9 pp, medium confidence
18Qwen3.6-35B-A3B80.1%estimated ± 5.9 pp, medium confidence
19GLM-5.179.5%estimated ± 5.9 pp, medium confidence
20K-EXAONE 2.078.6%measured
21MiniCPM5-2B67.5%estimated ± 5.9 pp, medium confidence
22ZAYA1-8B59.3%measured
23LongCat-Flash-Lite-Sparse49.4%measured
24MiniCPM5-1B34.1%estimated ± 5.9 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General