benchgap
Vision & documents

ZeroBench leaderboard

As of 2026-10-07, the highest measured score on ZeroBench is 41.0% by GPT-5.4. 20 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1LFM2.5-VL-3B74.8%estimated ± 6.4 pp, low confidence
2Claude Opus 4.666.4%estimated ± 9.3 pp, low confidence
3Qwen3.6-27B47.9%estimated ± 6.4 pp, low confidence
4Grok 4.2046.2%estimated ± 6.4 pp, low confidence
5Qwen3.6-35B-A3B44.2%estimated ± 6.4 pp, low confidence
6GPT-5.441.0%measured
7Muse Spark33.0%measured
8Gemini 3.1 Pro29.0%measured
9Qwen3.8 Max24.0%measured
10Kimi K323.0%measured
11dots3-note Preview19.0%measured
12Qwen3.8-Omni-Flash18.7%estimated ± 4.7 pp, low confidence
13Seed 2.1 Pro18.0%measured
14Step 3.7 Flash17.8%estimated ± 6.4 pp, low confidence
15Qwen3.8-Flash-Next17.5%estimated ± 4.7 pp, low confidence
16Qwen3.7 Plus17.2%estimated ± 4.7 pp, low confidence
17Qwen3.8-27B16.9%estimated ± 4.7 pp, low confidence
18Qwen3.5 397B15.6%estimated ± 4.7 pp, low confidence
19Qwen3.6 Plus15.0%estimated ± 4.7 pp, low confidence
20Kimi K2.614.5%estimated ± 4.7 pp, low confidence
21Gemini 3 Pro13.8%estimated ± 4.7 pp, low confidence
22Qwen3.5-122B-A10B13.5%estimated ± 4.7 pp, low confidence
23Qwen3.5-27B13.3%estimated ± 4.7 pp, low confidence
24Qwen3.5-35B-A3B11.7%estimated ± 4.7 pp, low confidence
25Seed 2.1 Turbo11.0%measured
26GPT-5.211.0%estimated ± 4.7 pp, low confidence
27Gemma 4 12B8.8%estimated ± 4.7 pp, low confidence
28Claude Opus 4.55.9%estimated ± 4.7 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General