benchgap
Vision & documents

AA-MMMU-Pro leaderboard

As of 2026-10-07, the highest measured score on AA-MMMU-Pro is 87.7% by Claude Opus 5.5. 25 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Opus 5.587.7%measured
2GPT-6 Astra86.9%measured
3GPT-6.1 Sol86.0%measured
4Gemini 3.8 Flash85.6%measured
5Gemini 3.7 Flash85.5%measured
6Claude Opus 584.7%measured
7Gemini 3.5 Flash84.3%measured
8Claude Opus 4.883.7%estimated ± 2.9 pp, high confidence
9Hy4 preview83.7%estimated ± 2.9 pp, high confidence
10Claude Sonnet 5.583.4%estimated ± 2.9 pp, high confidence
11GPT-5.6 Sol83.4%measured
12Gemini 3.6 Flash83.2%measured
13Claude Mythos 582.9%estimated ± 3.2 pp, medium confidence
14GPT-6 Sol82.9%measured
15Qwen3.8 Max Preview82.8%measured
16Gemini 3.1 Pro82.4%measured
17GLM-5.3-Flash81.9%estimated ± 2.9 pp, high confidence
18Seed 2.1 Pro81.2%estimated ± 2.2 pp, high confidence
19Seed 2.1 Turbo80.9%estimated ± 2.2 pp, high confidence
20GPT-5.6 Terra80.7%measured
21Kimi K380.5%measured
22Muse Spark80.5%measured
23Qwen3.7 Plus80.5%measured
24Grok 4.580.4%measured
25Gemini 3 Pro80.2%measured
26Claude Fable 580.2%estimated ± 2.9 pp, high confidence
27Qwen3.8 Max79.9%estimated ± 1.9 pp, medium confidence
28GPT-5.579.9%measured
29Qwen3.8-Flash-Next79.8%measured
30GPT-6 Luna79.7%measured
31dots3-note Preview79.7%estimated ± 3.0 pp, medium confidence
32Holo2-235B-A22B79.6%estimated ± 9.4 pp, medium confidence
33Qwen3.8-Omni-Flash79.5%estimated ± 1.9 pp, medium confidence
34Kimi K2.679.4%measured
35Apodex 1.179.2%measured
36Apodex 1.1 Mini79.2%measured
37Gemini 3.5 Flash-Lite79.0%measured
38Ling 3.0 Flash VL79.0%measured
39Claude Opus 4.7 (Adaptive)78.8%measured
40Gemini 3 Flash78.6%measured
41GPT-5.6 Luna78.6%measured
42MiniMax M378.6%measured
43GPT-5.3 Codex78.5%measured
44GPT-5.478.4%measured
45Grok 4.378.1%measured
46Qwen3.6 Plus78.0%measured
47GPT-5.277.6%estimated ± 4.9 pp, medium confidence
48Claude Sonnet 577.3%measured
49DeepSeek V4.1 Flash77.0%measured
50Claude Opus 4.776.4%measured
51Mistral Large 476.4%measured
52Step 5 Preview76.4%measured
53GPT-5.2-Codex76.3%measured
54Qwen3.8-27B76.3%measured
55Pareto 26.976.0%estimated ± 4.9 pp, medium confidence
56MiMo-V2.575.9%estimated ± 4.9 pp, medium confidence
57GPT-5.175.5%measured
58Claude Opus 4.6 (Adaptive)75.4%measured
59Kimi K2.575.4%measured
60Kimi K2.5 (Reasoning)75.4%measured
61Step 3.7 Flash75.3%measured
62Qwen3.5-122B-A10B75.0%measured
63Qwen3.5-27B75.0%measured
64Qwen3.6-35B-A3B75.0%measured
65Gemini 2.5 Pro74.9%measured
66Qwen3.6-27B74.6%measured
67GPT-5 (medium)74.3%measured
68Muse Glimmer 30B74.3%measured
69GPT-5 (high)74.2%measured
70Claude Opus 4.5 Thinking74.0%measured
71Inkling-Small74.0%measured
72Inkling73.5%measured
73Gemma 4 31B73.4%measured
74GPT-5.4 mini73.3%measured
75Grok 4.2073.2%estimated ± 2.2 pp, high confidence
76MiMo-V2.6-Flash73.1%measured
77GLM-5V-Turbo72.8%measured
78Qwen3.5-35B-A3B72.7%measured
79Claude Opus 4.672.5%measured
80GPT-5.1-Codex72.5%measured
81GPT-5.1-Codex-Max72.5%measured
82Claude Opus 4.571.2%measured
83Claude Sonnet 4.670.6%measured
84o370.1%measured
85MiMo-V2-Omni69.9%measured
86Interfaze Beta69.7%estimated ± 4.9 pp, medium confidence
87Gemma 4 12B69.7%measured
88Gemma 4 26B A4B69.2%measured
89Grok 468.8%measured
90Claude 4.1 Opus Thinking67.9%measured
91Ternary Bonsai 2 27B67.4%estimated ± 1.9 pp, low confidence
92Gemini 2.5 Flash65.5%measured
93GPT-5.4 nano65.4%measured
94Mistral Medium 3.5 128B64.9%measured
95Grok 4.1 Fast (Reasoning)63.3%measured
96Command A+63.2%measured
97Claude 4 Sonnet62.4%measured
98Llama 4 Maverick62.1%measured
99Grok 4 Fast (Reasoning)61.8%measured
100GPT-4.161.2%measured
101Holo2-30B-A3B60.6%estimated ± 9.4 pp, medium confidence
102Qwen3-Omni-30B-A3B-Thinking60.2%measured
103Holo2-4B59.0%estimated ± 9.4 pp, medium confidence
104Holo2-8B59.0%estimated ± 9.4 pp, medium confidence
105GPT-4.1 mini58.7%measured
106Mistral Small 456.8%measured
107Mistral Small 4 (Reasoning)56.8%measured
108Mistral Large 355.7%measured
109Qwen3-Omni-30B-A3B-Instruct55.5%measured
110Gemini 1.5 Pro55.0%measured
111Nemotron 3 Nano Omni 30B A3B53.2%measured
112Mistral Medium 353.0%measured
113Llama 4 Scout52.9%measured
114Qwen3.5 397B52.7%measured
115Qwen3.5 397B (Reasoning)52.7%measured
116Gemma 4 E4B51.4%measured
117Grok 4.1 Fast48.4%measured
118Gemma 3 27B48.0%measured
119Gemma 4 E2B44.6%measured
120Nova Pro44.3%measured
121GPT-4o mini41.5%measured
122GPT-4.1 nano40.1%measured
123Claude 3 Haiku30.8%measured
124North Micro Vision Instruct29.3%estimated ± 1.9 pp, low confidence
125LFM2.5-VL-1.6B-Extract26.5%measured
126LFM2.5-VL-3B16.2%estimated ± 1.2 pp, medium confidence
127ZAYA1-VL-8B15.2%estimated ± 1.2 pp, medium confidence
128Phi-4 Multimodal Instruct14.5%measured
129LFM2.5-VL-450M13.4%estimated ± 1.2 pp, medium confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General