benchgap
Calibration

ResearchClawBench → DeepSearchQA

DeepSearchQA is estimated from ResearchClawBench with a Michaelis–Menten curve fitted on 6 models measured on both: y = 1.4123·x / (0.12758 + x), R² = 0.42, cross-validated error 10.2 pp. It is used for 3 estimates.

Estimated modelResearchClawBenchDeepSearchQASource
Grok 4.113.5%72.6%estimated ± 10.2 pp, low confidence
MiMo-V2.516.9%80.5%estimated ± 10.2 pp, low confidence
MiMo-V2-Pro15.3%77.0%estimated ± 10.2 pp, low confidence