benchgap
Calibration

GPQA → AA-Omniscience Accuracy

AA-Omniscience Accuracy is estimated from GPQA with a offset logistic curve fitted on 60 models measured on both: y = 0.1622 + (1.2000 − 0.1622) / (1 + exp(−20.41·(x − 0.9741))), R² = 0.67, cross-validated error 8.1 pp. It is used for 15 estimates.

Estimated modelGPQAAA-Omniscience AccuracySource
Claude 3.5 Sonnet59.4%16.3%estimated ± 8.1 pp, medium confidence
Claude Mythos 594.1%51.2%estimated ± 8.1 pp, medium confidence
Interfaze Beta89.9%34.7%estimated ± 8.1 pp, medium confidence
LFM2.5-230M25.4%16.2%estimated ± 8.1 pp, low confidence
LFM2.5-VL-450M25.7%16.2%estimated ± 8.1 pp, low confidence
MAI-Thinking-184.2%22.8%estimated ± 8.1 pp, medium confidence
Ornith-1.5-35B-A3B89.2%32.6%estimated ± 8.1 pp, medium confidence
Ornith-1.5-397B92.8%45.4%estimated ± 8.1 pp, medium confidence
Ornith-1.5-9B86.4%26.1%estimated ± 8.1 pp, medium confidence
Qwen3.8-Omni-Flash91.0%38.3%estimated ± 8.1 pp, medium confidence
Sakana Fugu95.5%58.1%estimated ± 8.1 pp, medium confidence
Sakana Fugu-Ultra95.5%58.1%estimated ± 8.1 pp, medium confidence
Soofi S 30B-A3B43.4%16.2%estimated ± 8.1 pp, medium confidence
ZAYA1-74B-Preview57.3%16.3%estimated ± 8.1 pp, medium confidence
ZAYA1-8B71.0%16.7%estimated ± 8.1 pp, medium confidence