benchgap
Calibration

CharXiv → ScreenSpot Pro

ScreenSpot Pro is estimated from CharXiv with a Hill curve fitted on 12 models measured on both: y = 0.0000 + (1.0701 − 0.0000)·x^6.00 / (0.71035^6.00 + x^6.00), R² = 0.75, cross-validated error 7.1 pp. It is used for 15 estimates.

Estimated modelCharXivScreenSpot ProSource
Claude Mythos 593.5%89.8%estimated ± 7.1 pp, medium confidence
Claude Opus 4.7 (Adaptive)91.0%87.3%estimated ± 7.1 pp, medium confidence
Claude Sonnet 4.677.4%67.0%estimated ± 7.1 pp, medium confidence
Claude Sonnet 588.3%84.2%estimated ± 7.1 pp, medium confidence
Command A+52.7%15.3%estimated ± 7.1 pp, low confidence
Gemini 3.1 Flash-Lite73.2%58.3%estimated ± 7.1 pp, medium confidence
Gemini 3.5 Flash84.2%78.7%estimated ± 7.1 pp, medium confidence
Gemini 3.7 Flash88.7%84.7%estimated ± 7.1 pp, medium confidence
GLM-5.3-Flash89.4%85.5%estimated ± 7.1 pp, medium confidence
Inkling82.0%75.2%estimated ± 7.1 pp, medium confidence
Inkling-Small81.3%74.1%estimated ± 7.1 pp, medium confidence
MiMo-V2.581.0%73.6%estimated ± 7.1 pp, medium confidence
Muse Spark 1.188.4%84.3%estimated ± 7.1 pp, medium confidence
Sakana Fugu85.1%80.0%estimated ± 7.1 pp, medium confidence
Sakana Fugu-Ultra86.6%82.0%estimated ± 7.1 pp, medium confidence