Calibration
GPQA → ARC-AGI-3
ARC-AGI-3 is estimated from GPQA with a offset logistic curve fitted on 8 models measured on both: y = 0.0000 + (1.2000 − 0.0000) / (1 + exp(−200.00·(x − 0.9596))), R² = 1.00, cross-validated error 2.1 pp. It is used for 76 estimates.
| Estimated model | GPQA | ARC-AGI-3 | Source |
|---|---|---|---|
| Claude 3.5 Sonnet | 59.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Claude Mythos 5 | 94.1% | 2.8% | estimated ± 2.1 pp, high confidence |
| Claude Opus 4.5 | 87.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Claude Opus 4.6 | 91.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Claude Sonnet 4.5 | 83.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Claude Sonnet 4.6 | 89.9% | 0.0% | estimated ± 2.1 pp, medium confidence |
| DeepSeek V3 | 59.1% | 0.0% | estimated ± 2.1 pp, medium confidence |
| DeepSeek V4.1 Flash | 90.9% | 0.0% | estimated ± 2.1 pp, medium confidence |
| DeepSeek V4 Flash 0731 | 88.1% | 0.0% | estimated ± 2.1 pp, medium confidence |
| DeepSeek V4 Pro 0813 | 90.1% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Gemini 2.5 Pro | 83.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Gemini 3.5 Flash | 92.2% | 0.1% | estimated ± 2.1 pp, medium confidence |
| Gemma 4 12B | 78.8% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Gemma 4 31B | 84.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Gemma 4 E2B | 43.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Gemma 4 E4B | 58.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GLM-4.7 | 85.7% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GLM-5 | 86.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GLM-5.2 | 91.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GPT-4.1 | 66.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GPT-4.1 mini | 64.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GPT-4.1 nano | 50.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GPT-5.2 | 92.4% | 0.1% | estimated ± 2.1 pp, high confidence |
| GPT-5.4 mini | 88.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| GPT-5.4 nano | 82.8% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Granite 4.2 30B | 66.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Granite 4.2 3B | 54.8% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Granite 4.2 8B | 64.1% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Grok 4.3 | 90.1% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Hy3 Preview | 87.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Hy4 preview | 92.3% | 0.1% | estimated ± 2.1 pp, high confidence |
| Inkling | 87.9% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Inkling-Small | 89.5% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Interfaze Beta | 89.9% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Kimi K2.6 | 90.5% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Kimi K2.5 | 87.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Kimi K2.5 (Reasoning) | 87.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Kimi K3 | 93.5% | 0.9% | estimated ± 2.1 pp, high confidence |
| LFM2.5-230M | 25.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| LFM2.5-VL-450M | 25.7% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ling 2.6 Flash | 59.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ling 3.0 Flash | 85.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ling 3.0 Flash FP8 | 84.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| MAI-Thinking-1 | 84.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Mellum2-12B-A2.5B-Instruct | 40.9% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Mellum2-12B-A2.5B-Thinking | 57.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| MiMo-V2-Flash | 83.7% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Nemotron 3.5 Lightning 30B A3B NVFP4 | 75.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Nemotron 3 Nano Omni 30B A3B | 72.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Nemotron 3 Ultra | 87.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| o1 | 75.7% | 0.0% | estimated ± 2.1 pp, medium confidence |
| o1-pro | 79.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| o3-mini | 77.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ornith-1.5-35B-A3B | 89.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ornith-1.5-397B | 92.8% | 0.2% | estimated ± 2.1 pp, high confidence |
| Ornith-1.5-9B | 86.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3 235B 2507 | 77.5% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.5-122B-A10B | 86.6% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.5-27B | 85.5% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.5-35B-A3B | 84.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.5 397B | 88.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.6-27B | 87.8% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.6-35B-A3B | 86.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.6 Plus | 90.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.7 Max | 92.4% | 0.1% | estimated ± 2.1 pp, high confidence |
| Qwen3.7 Plus | 90.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.8-27B | 89.2% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.8-Flash-Next | 91.7% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Qwen3.8 Max | 92.6% | 0.1% | estimated ± 2.1 pp, high confidence |
| Qwen3.8-Omni-Flash | 91.0% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Sakana Fugu | 95.5% | 34.2% | estimated ± 2.1 pp, high confidence |
| Sakana Fugu-Ultra | 95.5% | 34.2% | estimated ± 2.1 pp, high confidence |
| Soofi S 30B-A3B | 43.4% | 0.0% | estimated ± 2.1 pp, medium confidence |
| Ternary Bonsai 2 27B | 85.8% | 0.0% | estimated ± 2.1 pp, medium confidence |
| ZAYA1-74B-Preview | 57.3% | 0.0% | estimated ± 2.1 pp, medium confidence |
| ZAYA1-8B | 71.0% | 0.0% | estimated ± 2.1 pp, medium confidence |