Calibration
ApprenticeBench → Toolathlon
Toolathlon is estimated from ApprenticeBench with a linear curve fitted on 5 models measured on both: y = 0.2198·x + 0.5142, R² = 0.68, cross-validated error 1.7 pp. It is used for 13 estimates.
| Estimated model | ApprenticeBench | Toolathlon | Source |
|---|---|---|---|
| Claude Fable 5 | 34.0% | 58.9% | estimated ± 1.7 pp, low confidence |
| Claude Fable 5.1 | 72.0% | 67.2% | estimated ± 1.7 pp, low confidence |
| Claude Opus 4.6 | 5.0% | 52.5% | estimated ± 1.7 pp, low confidence |
| Claude Opus 4.7 | 7.0% | 53.0% | estimated ± 1.7 pp, medium confidence |
| Claude Opus 5 | 36.0% | 59.3% | estimated ± 1.7 pp, low confidence |
| Claude Sonnet 4.6 | 2.0% | 51.9% | estimated ± 1.7 pp, low confidence |
| Claude Sonnet 5 | 16.0% | 54.9% | estimated ± 1.7 pp, medium confidence |
| Gemini 3.7 Flash | 16.0% | 54.9% | estimated ± 1.7 pp, medium confidence |
| Gemini 3.8 Flash | 24.0% | 56.7% | estimated ± 1.7 pp, medium confidence |
| GPT-6 Astra | 68.0% | 66.4% | estimated ± 1.7 pp, low confidence |
| Grok 4.6 | 13.0% | 54.3% | estimated ± 1.7 pp, medium confidence |
| Kimi K3 | 18.0% | 55.4% | estimated ± 1.7 pp, medium confidence |
| Muse Spark 1.3 | 19.0% | 55.6% | estimated ± 1.7 pp, medium confidence |