Calibration
Terminal-Bench 2.1 (Vals AI) → AA Terminal-Bench 2.1
AA Terminal-Bench 2.1 is estimated from Terminal-Bench 2.1 (Vals AI) with a Hill curve fitted on 11 models measured on both: y = 0.0000 + (0.9086 − 0.0000)·x^6.00 / (0.45312^6.00 + x^6.00), R² = 0.93, cross-validated error 4.4 pp. It is used for 29 estimates.
| Estimated model | Terminal-Bench 2.1 (Vals AI) | AA Terminal-Bench 2.1 | Source |
|---|---|---|---|
| Claude Haiku 4.5 | 43.8% | 40.8% | estimated ± 4.4 pp, medium confidence |
| Claude Opus 4.7 | 68.5% | 83.8% | estimated ± 4.4 pp, high confidence |
| Claude Opus 5 | 84.6% | 88.8% | estimated ± 4.4 pp, high confidence |
| Claude Sonnet 4.6 | 57.3% | 73.0% | estimated ± 4.4 pp, high confidence |
| Command A+ | 17.6% | 0.3% | estimated ± 4.4 pp, medium confidence |
| Composer 2.5 | 58.4% | 74.6% | estimated ± 4.4 pp, high confidence |
| Gemini 3.1 Flash-Lite | 34.1% | 14.0% | estimated ± 4.4 pp, medium confidence |
| Gemini 3.1 Pro | 70.8% | 85.0% | estimated ± 4.4 pp, high confidence |
| Gemini 3.6 Flash | 73.8% | 86.2% | estimated ± 4.4 pp, high confidence |
| Gemini 3 Flash | 53.9% | 67.2% | estimated ± 4.4 pp, high confidence |
| GLM-5.1 | 56.9% | 72.4% | estimated ± 4.4 pp, high confidence |
| GPT-5.4 mini | 54.7% | 68.7% | estimated ± 4.4 pp, high confidence |
| GPT-5.4 nano | 41.6% | 34.0% | estimated ± 4.4 pp, medium confidence |
| GPT-5.5 | 76.4% | 87.1% | estimated ± 4.4 pp, high confidence |
| Grok 4.20 | 44.2% | 42.1% | estimated ± 4.4 pp, medium confidence |
| Grok 4.3 | 41.9% | 35.0% | estimated ± 4.4 pp, medium confidence |
| Grok 4.6 | 78.3% | 87.6% | estimated ± 4.4 pp, high confidence |
| Kimi K2.6 | 53.6% | 66.6% | estimated ± 4.4 pp, high confidence |
| Kimi K2.7 Code | 67.0% | 82.9% | estimated ± 4.4 pp, high confidence |
| Laguna M.1 | 34.1% | 14.0% | estimated ± 4.4 pp, medium confidence |
| Laguna XS.2 | 25.8% | 3.0% | estimated ± 4.4 pp, medium confidence |
| Mercury 2.5 | 34.5% | 14.8% | estimated ± 4.4 pp, medium confidence |
| MiMo-V2.5 | 60.7% | 77.5% | estimated ± 4.4 pp, high confidence |
| MiMo-V2.5-Pro | 57.3% | 73.0% | estimated ± 4.4 pp, high confidence |
| MiniMax M2.7 | 48.7% | 55.1% | estimated ± 4.4 pp, high confidence |
| Mistral Medium 3.5 128B | 39.0% | 26.3% | estimated ± 4.4 pp, medium confidence |
| Qwen3.6 Plus | 53.2% | 65.8% | estimated ± 4.4 pp, high confidence |
| Qwen3.7 Max | 61.0% | 77.8% | estimated ± 4.4 pp, high confidence |
| Qwen3.7 Plus | 52.8% | 64.9% | estimated ± 4.4 pp, high confidence |