benchgap
Coding

ProgramBench leaderboard

As of 2026-10-07, the highest measured score on ProgramBench is 93.0% by Claude Opus 5. 18 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Opus 593.0%measured
2Claude Opus 5.591.2%measured
3Gemini 4 Argon90.9%estimated ± 4.8 pp, medium confidence
4GPT-6 Astra90.9%estimated ± 4.8 pp, medium confidence
5GPT-5.6 Sol90.9%estimated ± 4.8 pp, medium confidence
6Grok 4.689.4%estimated ± 6.0 pp, low confidence
7Claude Fable 589.1%estimated ± 6.0 pp, low confidence
8Gemini 3.8 Flash88.0%estimated ± 6.0 pp, low confidence
9Claude Opus 4.887.9%estimated ± 4.8 pp, medium confidence
10Claude Fable 5.187.6%measured
11GPT-5.6 Terra83.2%estimated ± 6.0 pp, low confidence
12Step 5 Preview80.5%measured
13Claude Sonnet 5.579.7%measured
14Claude Sonnet 578.3%estimated ± 6.0 pp, low confidence
15Kimi K377.8%measured
16GPT-5.6 Luna77.6%estimated ± 6.0 pp, low confidence
17Composer 2.568.1%estimated ± 6.0 pp, low confidence
18GLM-5.263.7%measured
19Gemini 3.6 Flash62.2%estimated ± 6.0 pp, low confidence
20Kimi K2.7 Code53.6%measured
21Gemini 3.5 Flash50.6%estimated ± 6.0 pp, low confidence
22MiMo-V2.6-Pro26.5%measured
23MiMo-V2.6-Flash26.0%measured
24DeepSeek V4.1 Flash20.3%measured
25GLM-5.319.0%measured
26Hy4 preview17.5%measured
27Claude Opus 4.70.5%estimated ± 4.8 pp, low confidence
28GPT-5.50.0%estimated ± 4.8 pp, low confidence
29Gemini 3.1 Pro0.0%estimated ± 4.8 pp, low confidence
30GPT-5.40.0%estimated ± 4.8 pp, low confidence
31Grok 4.50.0%estimated ± 4.8 pp, low confidence

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General