benchgap
Vision & documents

MMVU leaderboard

As of 2026-10-07, the highest measured score on MMVU is 82.4% by Qwen3.8 Max. 14 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Qwen3.8 Max82.4%measured
2GLM-5.3-Flash80.5%measured
3Kimi K2.580.4%measured
4Kimi K380.0%estimated ± 2.9 pp, medium confidence
5dots3-note Preview79.9%measured
6Seed 2.1 Pro79.1%estimated ± 2.9 pp, medium confidence
7Qwen3.8-Omni-Flash78.7%estimated ± 2.9 pp, medium confidence
8Qwen3.8-Flash-Next78.1%estimated ± 2.9 pp, medium confidence
9Qwen3.7 Plus77.9%estimated ± 2.9 pp, medium confidence
10Seed 2.1 Turbo77.8%estimated ± 2.9 pp, medium confidence
11Qwen3.8-27B77.7%estimated ± 2.9 pp, medium confidence
12Qwen3.5 397B77.0%estimated ± 2.9 pp, medium confidence
13Qwen3.6 Plus76.7%estimated ± 2.9 pp, medium confidence
14Kimi K2.676.4%estimated ± 2.9 pp, medium confidence
15Gemini 3 Pro75.9%estimated ± 2.9 pp, medium confidence
16Qwen3.5-122B-A10B74.7%measured
17GPT-5.273.9%estimated ± 2.9 pp, low confidence
18Qwen3.5-27B73.3%measured
19Qwen3.5-35B-A3B72.3%measured
20Gemma 4 12B72.1%estimated ± 2.9 pp, low confidence
21Claude Opus 4.568.8%estimated ± 2.9 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General