benchgap
Calibration

Gert Labs → OSWorld-Verified

OSWorld-Verified is estimated from Gert Labs with a Hill curve fitted on 13 models measured on both: y = 0.5161 + (0.9170 − 0.5161)·x^6.00 / (0.61788^6.00 + x^6.00), R² = 0.79, cross-validated error 5.9 pp. It is used for 31 estimates.

Estimated modelGert LabsOSWorld-VerifiedSource
Claude 4 Sonnet39.7%54.2%estimated ± 5.9 pp, medium confidence
DeepSeek V3.229.6%52.1%estimated ± 5.9 pp, medium confidence
Gemini 2.5 Pro42.0%55.2%estimated ± 5.9 pp, medium confidence
Gemini 3.1 Flash-Lite38.5%53.8%estimated ± 5.9 pp, medium confidence
Gemini 3.1 Pro56.9%66.8%estimated ± 5.9 pp, medium confidence
Gemini 3 Flash56.6%66.5%estimated ± 5.9 pp, medium confidence
Gemini 3 Pro63.2%73.0%estimated ± 5.9 pp, medium confidence
Gemma 4 31B35.3%53.0%estimated ± 5.9 pp, medium confidence
GLM-5V-Turbo30.8%52.2%estimated ± 5.9 pp, medium confidence
GPT-4.125.7%51.8%estimated ± 5.9 pp, low confidence
GPT-5.141.2%54.9%estimated ± 5.9 pp, medium confidence
GPT-5.1-Codex49.7%60.1%estimated ± 5.9 pp, medium confidence
GPT-5.2-Codex51.8%61.9%estimated ± 5.9 pp, medium confidence
GPT-OSS 120B29.6%52.1%estimated ± 5.9 pp, medium confidence
Grok 442.3%55.4%estimated ± 5.9 pp, medium confidence
Grok 4.1 Fast47.3%58.3%estimated ± 5.9 pp, medium confidence
Grok 4.2038.4%53.8%estimated ± 5.9 pp, medium confidence
Grok 4.343.9%56.2%estimated ± 5.9 pp, medium confidence
Grok Build 0.149.2%59.7%estimated ± 5.9 pp, medium confidence
Hy3 Preview36.9%53.4%estimated ± 5.9 pp, medium confidence
MiMo-V2.546.9%58.0%estimated ± 5.9 pp, medium confidence
MiMo-V2.5-Pro62.7%72.5%estimated ± 5.9 pp, medium confidence
MiMo-V2-Pro36.7%53.3%estimated ± 5.9 pp, medium confidence
MiniMax M2.740.4%54.5%estimated ± 5.9 pp, medium confidence
Mistral Medium 3.5 128B39.1%54.0%estimated ± 5.9 pp, medium confidence
Qwen3.6-27B54.8%64.8%estimated ± 5.9 pp, medium confidence
Qwen3.6-35B-A3B42.7%55.5%estimated ± 5.9 pp, medium confidence
Qwen3.6 Plus50.6%60.9%estimated ± 5.9 pp, medium confidence
Qwen3.7 Max64.3%74.0%estimated ± 5.9 pp, medium confidence
Qwen3 Max43.7%56.1%estimated ± 5.9 pp, medium confidence
Trinity-Large-Thinking32.6%52.5%estimated ± 5.9 pp, medium confidence