Multivariate
Each benchmark from several others
For each benchmark, candidates of any capability feed two searches combined - one elastic net fit whose lasso part zeroes the useless ones, and greedy forward selection trying every candidate - always ending with at least two; on what they find, the linear fit and a multivariate Michaelis–Menten curve compete by cross-validated error. Shown for analysis: the estimates come from the calibrations.
| Model | Fit | Models | Error | Best one alone |
|---|---|---|---|---|
| AA-GPQA Diamond ~ MMMU-Pro w/ Python + Artificial Analysis Intelligence Index | elastic net (multivariate) | 9 | 0.8 pp | 0.7 pp |
| AA-HLE ~ ARC-AGI-3 + AA-Omniscience Accuracy | elastic net (multivariate) | 16 | 2.3 pp | 2.3 pp |
| AA-SciCode ~ ARC-AGI-3 + AA-GPQA Diamond + AA-Omniscience Accuracy | elastic net (multivariate) | 11 | 1.0 pp | 1.1 pp |
| AIME26 ~ MMAnswerBench + Artificial Analysis Intelligence Index | elastic net (multivariate) | 10 | 0.6 pp | 0.7 pp |
| Artificial Analysis Intelligence Index ~ MMAnswerBench + AA-IFBench | elastic net (multivariate) | 10 | 1.7 pp | 1.9 pp |
| CritPt ~ HMMT Feb 2025 + AA-HLE | elastic net (multivariate) | 10 | 0.7 pp | 0.7 pp |
| GDPval-AA ~ Terminal-Bench 3.0 + AA Agentic Index | elastic net (multivariate) | 11 | 1.4 pp | 1.7 pp |
| GPQA Diamond ~ GPQA + Artificial Analysis Intelligence Index | elastic net (multivariate) | 31 | 0.4 pp | 0.4 pp |
| HLE ~ GPQA + GDPval-AA + CritPt | multivariate Michaelis–Menten | 30 | 6.1 pp | 6.2 pp |
| IFBench ~ HLE w/o tools + GPQA Diamond | multivariate Michaelis–Menten | 9 | 2.1 pp | 2.0 pp |
| AA-LCR ~ ARC-AGI-3 + CritPt + AA-HLE | elastic net (multivariate) | 16 | 1.7 pp | 1.9 pp |
| LiveCodeBench v6 ~ SWE-bench Pro + AA-HLE | elastic net (multivariate) | 10 | 1.2 pp | 1.9 pp |
| AA-Omniscience Accuracy ~ ARC-AGI-3 + AA-HLE | elastic net (multivariate) | 16 | 3.1 pp | 3.0 pp |
| SciCode ~ GPQA Diamond + IFBench + CritPt | elastic net (multivariate) | 14 | 1.8 pp | 2.5 pp |
| Terminal-Bench 2.1 ~ DeepSWE + CritPt | multivariate Michaelis–Menten | 20 | 1.9 pp | 1.8 pp |
| BrowseComp ~ ARC-AGI-3 + CritPt | multivariate Michaelis–Menten | 9 | 2.2 pp | 2.3 pp |
| HLE w/ tools ~ HLE w/o tools + SWE-bench Pro | elastic net (multivariate) | 9 | 2.4 pp | 2.6 pp |
| IFEval ~ AA-IFBench + GPQA | multivariate Michaelis–Menten | 15 | 1.0 pp | 1.2 pp |
| LongBench v2 ~ MMLU-ProX + τ²-bench results | elastic net (multivariate) | 9 | 0.6 pp | 0.6 pp |
| VITA-Bench ~ Terminal-Bench 2.0 + SWE-bench Verified | elastic net (multivariate) | 9 | 9.4 pp | 10.0 pp |
| τ²-bench results ~ SuperGPQA + AA-IFBench + AA-LCR | multivariate Michaelis–Menten | 15 | 3.0 pp | 3.1 pp |
| AA Coding Index ~ CursorBench 4.0 + AA-GPQA Diamond | elastic net (multivariate) | 9 | 0.8 pp | 1.0 pp |
| AA-MMMU-Pro ~ ARC-AGI-3 + ExploitGym | multivariate Michaelis–Menten | 9 | 0.7 pp | 0.8 pp |
| APEX-Agents-AA ~ GPQA Diamond + GDPval-AA + AA-LCR | elastic net (multivariate) | 14 | 4.7 pp | 5.4 pp |
| DeepSearchQA ~ SWE-bench Pro + AA-Omniscience Accuracy | elastic net (multivariate) | 10 | 5.4 pp | 6.7 pp |
| SWE-bench Verified ~ SWE-bench Pro + GPQA + AA-Omniscience Accuracy | multivariate Michaelis–Menten | 20 | 1.2 pp | 2.0 pp |
| AutomationBench ~ Vals LiveCodeBench + DeepSWE | elastic net (multivariate) | 9 | 4.1 pp | 4.5 pp |
| BFCL v4 ~ AA-GPQA Diamond + AA-Omniscience Accuracy | multivariate Michaelis–Menten | 9 | 3.2 pp | 3.2 pp |
| CyberGym ~ AutomationBench + CritPt | multivariate Michaelis–Menten | 9 | 4.7 pp | 3.7 pp |
| JobBench ~ DeepSWE + Terminal-Bench 2.1 | multivariate Michaelis–Menten | 9 | 6.0 pp | 6.0 pp |
| SWE-bench Pro ~ MMAnswerBench + Terminal-Bench 2.0 | multivariate Michaelis–Menten | 9 | 1.3 pp | 1.4 pp |
| τ³-bench results ~ SWE-bench Verified + AA-GPQA Diamond | multivariate Michaelis–Menten | 11 | 17.7 pp | 17.7 pp |
| WideResearch ~ SWE Multilingual + GPQA | multivariate Michaelis–Menten | 11 | 4.5 pp | 4.5 pp |
| AA Agentic Index ~ GDPval-AA + Terminal-Bench 3.0 + AA-HLE | elastic net (multivariate) | 11 | 1.9 pp | 1.8 pp |
| MMLU-Pro ~ MMLU-ProX + AA-Omniscience Accuracy | elastic net (multivariate) | 11 | 0.5 pp | 0.6 pp |
| FrontierMath v2 (Tier 4) ~ FrontierMath v2 (Tiers 1-3) + CritPt + AA-GPQA Diamond | elastic net (multivariate) | 34 | 5.5 pp | 6.2 pp |
| FrontierMath v2 (Tiers 1-3) ~ CharXiv + FrontierMath v2 (Tier 4) | multivariate Michaelis–Menten | 11 | 2.6 pp | 2.6 pp |
| GPQA ~ GPQA Diamond + AA Coding Index | elastic net (multivariate) | 28 | 0.1 pp | 0.1 pp |
| AA-IFBench ~ SciCode + AA-Omniscience Accuracy | multivariate Michaelis–Menten | 10 | 4.4 pp | 4.4 pp |
| Gert Labs ~ MMAnswerBench + AA-HLE | elastic net (multivariate) | 9 | 4.7 pp | 5.9 pp |
| AA EnterpriseOps-Gym ~ GDP.pdf + Artificial Analysis Intelligence Index | elastic net (multivariate) | 9 | 4.5 pp | 4.4 pp |
| ApprenticeBench ~ ARC-AGI-3 + AA-LCR | elastic net (multivariate) | 9 | 4.7 pp | 4.9 pp |
| ARC-AGI-1 ~ AA-AnalystAgent + AA-Omniscience Accuracy | elastic net (multivariate) | 10 | 0.9 pp | 0.9 pp |
| ARC-AGI-2 ~ ARC-AGI-1 + ApprenticeBench | elastic net (multivariate) | 14 | 6.9 pp | 7.1 pp |
| CursorBench 3.2 ~ CursorBench 4.0 + Terminal-Bench 2.1 (Vals AI) | multivariate Michaelis–Menten | 9 | 2.4 pp | 2.2 pp |
| Terminal-Bench 3.0 ~ GDPval-AA + AA-Omniscience Accuracy + CritPt | elastic net (multivariate) | 11 | 1.9 pp | 4.7 pp |
| FrontierCode 1.1 Main ~ AA-HLE + AA-GPQA Diamond + Artificial Analysis Intelligence Index | multivariate Michaelis–Menten | 11 | 1.5 pp | 2.6 pp |
| FrontierSWE v2 ~ AA Terminal-Bench 4.0 + CritPt + AA-LCR | elastic net (multivariate) | 11 | 4.3 pp | 6.6 pp |
| OfficeQA Pro ~ GDPval-AA + AA-SciCode | multivariate Michaelis–Menten | 9 | 5.2 pp | 5.2 pp |
| OSWorld-Verified ~ GDPval-AA + AA-MMMU-Pro | multivariate Michaelis–Menten | 16 | 7.9 pp | 9.5 pp |
| Vals GPQA Diamond ~ ARC-AGI-3 + AA-GPQA Diamond | elastic net (multivariate) | 10 | 1.1 pp | 1.0 pp |
| Vals LiveCodeBench ~ IFBench + Vals MMLU-Pro | multivariate Michaelis–Menten | 10 | 0.8 pp | 0.7 pp |
| Vals MMLU-Pro ~ CyberGym + Vals GPQA Diamond | multivariate Michaelis–Menten | 11 | 1.0 pp | 1.0 pp |
| Vals SWE-bench ~ Claw-Eval + AA-LCR + Vals GPQA Diamond | multivariate Michaelis–Menten | 11 | 2.9 pp | 2.7 pp |
| Terminal-Bench 2.1 (Vals AI) ~ FrontierCode 1.1 Main + Vals GPQA Diamond | elastic net (multivariate) | 9 | 3.2 pp | 3.7 pp |
| VulcanBench v3 ~ Vals MMLU-Pro + GDPval-AA | elastic net (multivariate) | 12 | 4.2 pp | 4.7 pp |
| AA AutomationBench ~ AA Terminal-Bench 4.0 + GDPval-AA | multivariate Michaelis–Menten | 22 | 6.2 pp | 6.2 pp |
| GDP.pdf ~ Agents' Last Exam + AA-HLE | elastic net (multivariate) | 9 | 2.4 pp | 3.4 pp |
| AA ITBench ~ Vals GPQA Diamond + Artificial Analysis Intelligence Index | multivariate Michaelis–Menten | 9 | 3.5 pp | 3.4 pp |
| AA Tau3 Banking ~ DeepSWE + AA-GPQA Diamond | multivariate Michaelis–Menten | 9 | 3.2 pp | 3.2 pp |
| AA Terminal-Bench 2.1 ~ AA Coding Index + AA-SciCode | elastic net (multivariate) | 11 | 0.9 pp | 1.8 pp |
| AA Terminal-Bench 4.0 ~ Terminal-Bench 4.0 + GDPval-AA | elastic net (multivariate) | 10 | 3.7 pp | 4.8 pp |
| CursorBench 4.0 ~ AA Coding Index + AA-GPQA Diamond | elastic net (multivariate) | 9 | 1.5 pp | 2.1 pp |
| CWE-bench v1 ~ Artificial Analysis Intelligence Index + CritPt | elastic net (multivariate) | 10 | 5.1 pp | 6.0 pp |
| DeepSWE ~ ExploitBench + Artificial Analysis Intelligence Index | elastic net (multivariate) | 9 | 2.0 pp | 1.9 pp |
| HLE w/o tools ~ HLE w/ tools + SWE-bench Pro | elastic net (multivariate) | 9 | 1.7 pp | 3.9 pp |
| OSWorld 2.0 ~ FrontierMath v2 (Tier 4) + AA-GPQA Diamond | elastic net (multivariate) | 9 | 4.1 pp | 5.2 pp |
| PostTrainBench v1.1 ~ Vals SWE-bench + AA-GPQA Diamond | elastic net (multivariate) | 9 | 3.0 pp | 3.5 pp |
| ProgramBench ~ AA-HLE + AutomationBench | elastic net (multivariate) | 9 | 17.1 pp | 18.1 pp |
| SWE Multilingual ~ SWE-bench Verified + CritPt + HLE | multivariate Michaelis–Menten | 15 | 2.4 pp | 1.6 pp |
| Terminal-Bench 4.0 ~ AA Terminal-Bench 4.0 + Artificial Analysis Intelligence Index + CritPt | elastic net (multivariate) | 11 | 3.3 pp | 5.1 pp |
| Toolathlon-Verified ~ ProgramBench + CritPt | multivariate Michaelis–Menten | 10 | 1.9 pp | 1.8 pp |
| Vibe Code Bench ~ AA Coding Index + CritPt + τ²-bench results | elastic net (multivariate) | 16 | 10.0 pp | 10.8 pp |
| CharXiv ~ SWE-bench Pro + AA-HLE + AA-Omniscience Accuracy | elastic net (multivariate) | 20 | 3.6 pp | 3.6 pp |
| CharXiv w/o tools ~ AA-MMMU-Pro + AA-HLE | multivariate Michaelis–Menten | 9 | 2.4 pp | 2.4 pp |
| ExploitBench ~ AA-HLE + AA-SciCode | elastic net (multivariate) | 9 | 15.7 pp | 17.9 pp |
| ExploitGym ~ AA-MMMU-Pro + ARC-AGI-2 | elastic net (multivariate) | 9 | 4.6 pp | 4.3 pp |
| Claw-Eval ~ ResearchClawBench + SWE-bench Pro | multivariate Michaelis–Menten | 10 | 3.8 pp | 3.7 pp |
| HMMT Feb 2025 ~ Artificial Analysis Intelligence Index + SWE-bench Verified | multivariate Michaelis–Menten | 9 | 3.1 pp | 3.0 pp |
| HMMT Feb 2026 ~ QwenClawBench + CritPt | multivariate Michaelis–Menten | 9 | 1.4 pp | 1.3 pp |
| HMMT Nov 2025 ~ HLE + τ²-bench results | multivariate Michaelis–Menten | 9 | 1.7 pp | 1.7 pp |
| MathVision ~ CharXiv + GPQA | multivariate Michaelis–Menten | 12 | 2.7 pp | 2.7 pp |
| MCP Atlas ~ AA-HLE + AA-Omniscience Accuracy | elastic net (multivariate) | 31 | 11.8 pp | 11.8 pp |
| MMAnswerBench ~ AIME26 + SWE-bench Pro | elastic net (multivariate) | 10 | 1.2 pp | 1.4 pp |
| MMLU-ProX ~ LongBench v2 + τ²-bench results | elastic net (multivariate) | 9 | 0.5 pp | 0.5 pp |
| MMMU-Pro ~ MMMU-Pro w/ Python + AA-Omniscience Accuracy | elastic net (multivariate) | 9 | 1.1 pp | 1.3 pp |
| NL2Repo ~ Terminal-Bench 2.1 + SWE Multilingual | elastic net (multivariate) | 10 | 3.8 pp | 3.7 pp |
| QwenClawBench ~ CritPt + HLE | multivariate Michaelis–Menten | 9 | 1.2 pp | 1.2 pp |
| ScreenSpot Pro ~ CharXiv + CritPt | elastic net (multivariate) | 11 | 6.4 pp | 7.3 pp |
| SuperGPQA ~ MMLU-ProX + MMLU-Pro | elastic net (multivariate) | 11 | 1.4 pp | 1.3 pp |
| Terminal-Bench 2.0 ~ MMAnswerBench + AA-Omniscience Accuracy | elastic net (multivariate) | 9 | 2.9 pp | 3.6 pp |
| Toolathlon ~ ARC-AGI-1 + AA-Omniscience Accuracy | multivariate Michaelis–Menten | 11 | 2.9 pp | 3.0 pp |
| V* ~ MathVision + CritPt | elastic net (multivariate) | 9 | 3.9 pp | 5.1 pp |
| VideoMMMU ~ AA-Omniscience Accuracy + MMMU-Pro | elastic net (multivariate) | 9 | 0.7 pp | 1.1 pp |
| ERQA ~ CharXiv + SWE-bench Pro | elastic net (multivariate) | 9 | 3.1 pp | 3.5 pp |
| HealthBench Hard ~ GDPval-AA + AA-LCR | elastic net (multivariate) | 10 | 6.8 pp | 5.9 pp |
| React Native Evals ~ FrontierMath v2 (Tier 4) + Artificial Analysis Intelligence Index | multivariate Michaelis–Menten | 10 | 1.9 pp | 2.2 pp |
| ResearchClawBench ~ Claw-Eval + SWE-bench Pro | multivariate Michaelis–Menten | 10 | 1.3 pp | 1.1 pp |
| SWE-Rebench ~ Terminal-Bench 2.0 + AA-LCR | elastic net (multivariate) | 10 | 3.9 pp | 4.2 pp |
| ARC-AGI-3 ~ AA-HLE + GDPval-AA | elastic net (multivariate) | 16 | 13.6 pp | 13.6 pp |
| HealthBench Professional ~ AA-MMMU-Pro + AA-SciCode | elastic net (multivariate) | 9 | 2.0 pp | 1.9 pp |
| AIME 2025 ~ SWE-bench Verified + GPQA | multivariate Michaelis–Menten | 9 | 3.2 pp | 3.0 pp |
| Agents' Last Exam ~ GDP.pdf + AA-HLE | elastic net (multivariate) | 9 | 5.6 pp | 6.4 pp |
| OpenHarmony Bench ~ Terminal-Bench 2.1 + Terminal-Bench 2.1 (Vals AI) | multivariate Michaelis–Menten | 9 | 2.1 pp | 2.0 pp |
| SEC-Bench Pro ~ ExploitGym + GDPval-AA | elastic net (multivariate) | 9 | 7.5 pp | 9.1 pp |
| MMMU-Pro w/ Python ~ MMMU-Pro + AA-Omniscience Accuracy | elastic net (multivariate) | 9 | 0.6 pp | 0.9 pp |