benchgap
xAI · model

Grok 3 [Beta] benchmark scores

As of 2026-10-07, Grok 3 [Beta] (xAI) has measured scores on 2 benchmarks and estimated scores on 4 more.

BenchmarkScoreSource
AIME2695.5%estimated ± 0.6 pp, low confidence
FrontierMath v2 (Tier 4)0.0%measured
FrontierMath v2 (Tiers 1-3)3.8%measured
HMMT Nov 202599.9%estimated ± 2.6 pp, low confidence
MMAnswerBench81.9%estimated ± 1.3 pp, low confidence
FrontierMath (legacy)4.9%estimated ± 0.7 pp, low confidence