benchgap
Math

FrontierMath v2 (Tiers 1-3) leaderboard

As of 2026-10-07, the highest measured score on FrontierMath v2 (Tiers 1-3) is 89.0% by GPT-5.6 Sol. 19 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1GPT-6 Astra93.1%estimated ± 7.4 pp, low confidence
2GPT-5.6 Sol89.0%measured
3GPT-5.6 Terra84.9%measured
4GPT-5.6 Luna78.6%measured
5GPT-5.551.7%measured
6GPT-5.5 Pro51.0%measured
7GPT-5.4 Pro50.0%measured
8GPT-5.447.6%measured
9Claude Opus 4.847.2%measured
10Claude Opus 4.743.8%measured
11Claude Opus 4.7 (Adaptive)43.3%estimated ± 0.7 pp, low confidence
12Claude Opus 4.640.7%measured
13GPT-5.240.7%measured
14Muse Spark39.0%measured
15Qwen3.7 Max39.0%estimated ± 8.4 pp, low confidence
16DeepSeek V4 Flash 073139.0%estimated ± 8.4 pp, low confidence
17DeepSeek V4 Pro 081339.0%estimated ± 8.4 pp, low confidence
18Solar Open 239.0%estimated ± 8.4 pp, low confidence
19Qwen3.7 Plus39.0%estimated ± 8.4 pp, low confidence
20Gemini 3.5 Flash39.0%measured
21Kimi K2.639.0%measured
22GLM-5.239.0%estimated ± 8.4 pp, low confidence
23Inkling-Small38.3%estimated ± 8.4 pp, low confidence
24Gemini 3 Pro37.6%measured
25Gemini 3.1 Pro36.9%measured
26Gemini 3 Flash35.6%measured
27GLM-5.133.4%measured
28Claude Sonnet 4.632.4%measured
29GPT-5.131.0%measured
30GPT-5.4 mini28.3%measured
31Kimi K2.527.9%measured
32Qwen3.5 397B26.8%estimated ± 8.4 pp, low confidence
33Qwen3.6 Plus26.2%measured
34GPT-5.4 nano25.9%measured
35Ling 3.0 Flash24.8%estimated ± 8.4 pp, low confidence
36o4-mini (high)24.8%measured
37MAI-Thinking-124.4%estimated ± 8.4 pp, low confidence
38Qwen3.6-27B24.4%estimated ± 8.4 pp, low confidence
39Qwen3.6-35B-A3B24.4%estimated ± 8.4 pp, low confidence
40K-EXAONE 2.024.4%estimated ± 8.4 pp, low confidence
41LongCat-Flash-Lite-Sparse24.4%estimated ± 8.4 pp, low confidence
42MiniCPM5-1B24.4%estimated ± 8.4 pp, low confidence
43MiniCPM5-2B24.4%estimated ± 8.4 pp, low confidence
44ZAYA1-8B24.4%estimated ± 8.4 pp, low confidence
45Qwen 3.6 Max (preview)23.1%measured
46DeepSeek V3.222.1%measured
47Kimi K221.4%measured
48Qwen3.5 Plus21.0%measured
49Claude Opus 4.520.7%measured
50Grok 419.7%measured
51o318.7%measured
52GLM-516.4%measured
53Gemini 2.5 Pro14.1%measured
54Claude Sonnet 4.513.5%measured
55o19.3%measured
56Qwen3 235B 2507 (Reasoning)8.5%measured
57Qwen3.5 Flash6.2%measured
58Claude Haiku 4.55.9%measured
59GPT-4.15.5%measured
60Gemini 2.5 Flash4.8%measured
61GPT-4.1 mini4.5%measured
62GLM-4.63.8%measured
63Grok 3 [Beta]3.8%measured
64GLM-4.72.4%measured
65Claude 3.5 Sonnet2.1%measured
66DeepSeek V31.7%measured
67GPT-4.1 nano1.0%measured
68Llama 4 Maverick0.7%measured
69GPT-4o0.3%measured
70Llama 4 Scout0.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General