benchgap
Math

FrontierMath v2 (Tier 4) leaderboard

As of 2026-10-07, the highest measured score on FrontierMath v2 (Tier 4) is 97.6% by GPT-6 Astra. 12 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1GPT-6 Astra97.6%measured
2GPT-5.6 Sol83.0%measured
3GPT-5.6 Terra68.3%measured
4GPT-5.6 Luna58.5%measured
5GPT-5.5 Pro39.6%measured
6GPT-5.4 Pro37.5%measured
7GPT-5.535.4%measured
8Claude Opus 4.7 (Adaptive)35.2%estimated ± 5.0 pp, low confidence
9Claude Opus 4.831.3%measured
10GLM-5.227.8%estimated ± 3.7 pp, low confidence
11GPT-5.427.1%measured
12Claude Opus 4.722.9%measured
13Claude Opus 4.622.9%measured
14GPT-5.218.8%measured
15Gemini 3 Pro18.8%measured
16Gemini 3.1 Pro16.7%measured
17Muse Spark14.6%measured
18Gemini 3.5 Flash14.6%measured
19Kimi K2.614.6%measured
20GLM-5.112.5%measured
21GPT-5.112.5%measured
22Qwen3.6 Plus8.3%measured
23Claude Sonnet 4.68.3%measured
24GPT-5.4 nano6.3%measured
25o4-mini (high)6.3%measured
26Kimi K2.54.2%measured
27Claude Opus 4.54.2%measured
28Claude Sonnet 4.54.2%measured
29Gemini 2.5 Flash4.2%measured
30Gemini 2.5 Pro4.2%measured
31Gemini 3 Flash4.2%measured
32Qwen 3.6 Max (preview)4.2%measured
33GLM-4.62.1%measured
34DeepSeek V3.22.1%measured
35GLM-52.1%measured
36Claude Haiku 4.52.1%measured
37Grok 42.1%measured
38o32.1%measured
39Qwen3.5 Plus2.1%measured
40GPT-5.4 mini2.1%measured
41o11.2%estimated ± 4.5 pp, high confidence
42GPT-4.1 mini1.2%estimated ± 4.5 pp, high confidence
43DeepSeek V31.2%estimated ± 4.5 pp, medium confidence
44GPT-4.1 nano1.2%estimated ± 4.5 pp, medium confidence
45GPT-4o1.2%estimated ± 4.5 pp, medium confidence
46Llama 4 Maverick1.2%estimated ± 4.5 pp, medium confidence
47Llama 4 Scout1.2%estimated ± 4.5 pp, medium confidence
48Qwen3.5 397B0.1%estimated ± 3.7 pp, low confidence
49Claude 3.5 Sonnet0.0%measured
50GLM-4.70.0%measured
51GPT-4.10.0%measured
52Grok 3 [Beta]0.0%measured
53Kimi K20.0%measured
54Qwen3 235B 2507 (Reasoning)0.0%measured
55Qwen3.5 Flash0.0%measured
56Qwen3.6-27B0.0%estimated ± 3.7 pp, low confidence
57Qwen3.6-35B-A3B0.0%estimated ± 3.7 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General