benchgap
Calibration

AA Coding Index → FrontierCode 1.1 Main

FrontierCode 1.1 Main is estimated from AA Coding Index with a inverse Michaelis–Menten curve fitted on 8 models measured on both: y = 0.32262·(x − 0.0000) / (0.0000 + 1.2617 − x), R² = 0.87, cross-validated error 3.8 pp. It is used for 46 estimates.

Estimated modelAA Coding IndexFrontierCode 1.1 MainSource
Apodex 1.1 Mini60.8%30.0%estimated ± 3.8 pp, high confidence
Celeris-114.4%4.2%estimated ± 3.8 pp, medium confidence
Claude 3 Opus19.5%5.9%estimated ± 3.8 pp, medium confidence
Command A+27.9%9.1%estimated ± 3.8 pp, medium confidence
Gemini 1.5 Pro23.6%7.4%estimated ± 3.8 pp, medium confidence
Gemini 3.5 Flash-Lite49.3%20.7%estimated ± 3.8 pp, medium confidence
Gemma 3 27B10.1%2.8%estimated ± 3.8 pp, medium confidence
Gemma 4 12B31.0%10.5%estimated ± 3.8 pp, medium confidence
Gemma 4 26B A4B39.3%14.6%estimated ± 3.8 pp, medium confidence
Gemma 4 31B43.4%16.9%estimated ± 3.8 pp, medium confidence
Gemma 4 E2B7.2%2.0%estimated ± 3.8 pp, medium confidence
Gemma 4 E4B9.4%2.6%estimated ± 3.8 pp, medium confidence
GLM-5.155.8%25.6%estimated ± 3.8 pp, medium confidence
GPT-4.1 nano11.1%3.1%estimated ± 3.8 pp, medium confidence
GPT-4 Turbo21.5%6.6%estimated ± 3.8 pp, medium confidence
GPT-4o mini11.4%3.2%estimated ± 3.8 pp, medium confidence
GPT-5.149.4%20.8%estimated ± 3.8 pp, medium confidence
GPT-5.4 nano56.1%25.8%estimated ± 3.8 pp, medium confidence
GPT-5 (high)37.8%13.8%estimated ± 3.8 pp, medium confidence
GPT-OSS 120B30.4%10.3%estimated ± 3.8 pp, medium confidence
GPT-OSS 20B20.7%6.3%estimated ± 3.8 pp, medium confidence
Grok 4.342.3%16.2%estimated ± 3.8 pp, medium confidence
Hy358.8%28.2%estimated ± 3.8 pp, high confidence
K-Exaone32.1%11.0%estimated ± 3.8 pp, medium confidence
LFM2.5-2.6B7.7%2.1%estimated ± 3.8 pp, medium confidence
Ling 2.6 Flash25.3%8.1%estimated ± 3.8 pp, medium confidence
Ling 3.0 Flash50.6%21.6%estimated ± 3.8 pp, medium confidence
Ling 3.0 Flash FP850.6%21.6%estimated ± 3.8 pp, medium confidence
Llama 4 Maverick16.3%4.8%estimated ± 3.8 pp, medium confidence
Llama 4 Scout8.2%2.2%estimated ± 3.8 pp, medium confidence
MiMo-V2.5-Pro60.2%29.4%estimated ± 3.8 pp, high confidence
MiniMax M2.752.6%23.1%estimated ± 3.8 pp, medium confidence
Mistral Large 320.1%6.1%estimated ± 3.8 pp, medium confidence
Mistral Small 426.6%8.6%estimated ± 3.8 pp, medium confidence
Mistral Small 4 (Reasoning)26.6%8.6%estimated ± 3.8 pp, medium confidence
Nemotron 3 Nano 30B14.4%4.1%estimated ± 3.8 pp, medium confidence
Nemotron 3 Nano Omni 30B A3B13.8%3.9%estimated ± 3.8 pp, medium confidence
Nemotron 3 Super 100B37.7%13.8%estimated ± 3.8 pp, medium confidence
o139.7%14.8%estimated ± 3.8 pp, medium confidence
o1-preview34.1%11.9%estimated ± 3.8 pp, medium confidence
Quasar 438B61.2%30.4%estimated ± 3.8 pp, high confidence
Qwen3.8 Max Preview71.8%42.6%estimated ± 3.8 pp, high confidence
Step 3.7 Flash39.6%14.7%estimated ± 3.8 pp, medium confidence
Trinity-Large-Preview25.8%8.3%estimated ± 3.8 pp, medium confidence
Trinity-Large-Thinking25.8%8.3%estimated ± 3.8 pp, medium confidence
Ultravox v0.6 Llama 3.3 70B11.9%3.4%estimated ± 3.8 pp, medium confidence