benchgap
Agentic · tools

SkillsBench leaderboard

As of 2026-10-07, the highest measured score on SkillsBench is 70.2% by Qwen3.8 Max. 10 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Qwen3.8 Max70.2%measured
2Ling 3.1 Flash68.7%measured
3Atria Dawn Preview66.4%measured
4Hy4 preview62.9%measured
5Kimi K2.661.3%estimated ± 5.6 pp, low confidence
6Ornith-1.5-397B61.3%estimated ± 5.6 pp, low confidence
7dots3-note Preview52.8%measured
8Claude Opus 4.551.2%estimated ± 5.6 pp, low confidence
9Qwen3.6 Plus46.4%estimated ± 5.6 pp, low confidence
10Qwen3.5 397B45.7%estimated ± 5.6 pp, low confidence
11Ling 3.0 Flash44.8%measured
12Muse Glimmer 30B44.3%measured
13Kimi K2.542.8%estimated ± 5.6 pp, low confidence
14GLM-536.3%estimated ± 5.6 pp, low confidence
15Ornith-1.5-35B-A3B32.0%estimated ± 5.6 pp, low confidence
16Qwen3.6-35B-A3B18.0%estimated ± 5.6 pp, low confidence
17Ornith-1.5-9B17.1%estimated ± 5.6 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General