benchgap
Calibration

CursorBench 4.0 → VulcanBench v3

VulcanBench v3 is estimated from CursorBench 4.0 with a offset logistic curve fitted on 5 models measured on both: y = 0.6998 + (0.8700 − 0.6998) / (1 + exp(−175.03·(x − 0.3457))), R² = 1.00, cross-validated error 0.7 pp. It is used for 8 estimates.

Estimated modelCursorBench 4.0VulcanBench v3Source
Claude Fable 5.151.8%87.0%estimated ± 0.7 pp, low confidence
Claude Opus 5.557.8%87.0%estimated ± 0.7 pp, low confidence
Claude Sonnet 534.1%75.2%estimated ± 0.7 pp, low confidence
Claude Sonnet 5.555.5%87.0%estimated ± 0.7 pp, low confidence
Composer 2.527.7%70.0%estimated ± 0.7 pp, low confidence
Gemini 3.8 Flash39.6%87.0%estimated ± 0.7 pp, medium confidence
Grok 4.746.3%87.0%estimated ± 0.7 pp, medium confidence
Muse Spark 1.341.6%87.0%estimated ± 0.7 pp, medium confidence