benchgap
Multilingual

SWE Multilingual leaderboard

As of 2026-10-07, the highest measured score on SWE Multilingual is 93.9% by Claude Opus 5.5. 9 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1Claude Opus 5.593.9%measured
2Claude Mythos 592.2%measured
3Claude Sonnet 5.590.3%measured
4Claude Opus 589.5%measured
5Claude Fable 5.189.1%measured
6Claude Opus 4.884.4%measured
7Hy4 preview82.9%measured
8Qwen3.8-Flash-Next81.0%measured
9Qwen3.8-Omni-Flash80.5%measured
10Composer 2.579.8%measured
11Ornith-1.5-397B79.6%measured
12Ornith-1.0-397B78.9%measured
13Laguna S 2.178.5%measured
14Claude Sonnet 578.3%measured
15Qwen3.7 Max78.3%measured
16Grok 4.578.0%measured
17Beam78.0%measured
18SWE-1.777.8%measured
19Claude Opus 4.577.5%measured
20Qwen3.5 397B76.8%estimated ± 2.1 pp, low confidence
21Kimi K2.676.7%measured
22MiniMax M2.776.5%measured
23DeepSeek V4 Pro 081376.2%measured
24Qwen3.7 Plus75.8%measured
25dots3-note Preview75.7%measured
26Qwen3.6 Plus73.8%measured
27Composer 273.7%measured
28DeepSeek V4 Flash 073173.3%measured
29GLM-573.3%measured
30Kimi K2.573.0%measured
31Ling 3.0 Flash72.4%measured
32Ornith-1.5-35B-A3B71.4%measured
33Qwen3.6-27B71.3%measured
34Qwen3.5-122B-A10B70.5%estimated ± 2.6 pp, low confidence
35Qwen3.5-27B70.5%estimated ± 2.6 pp, low confidence
36Ornith-1.0-35B69.3%measured
37Qwen3.5-35B-A3B68.6%estimated ± 2.6 pp, low confidence
38Nemotron 3 Ultra67.7%measured
39Qwen3.6-35B-A3B67.2%measured
40Qwen3 235B 250766.2%estimated ± 2.6 pp, low confidence
41Laguna M.163.1%measured
42Laguna XS 2.163.1%measured
43LongCat-Flash-Lite-Sparse59.3%measured
44Laguna XS.257.7%measured
45GPT-4.156.7%estimated ± 2.6 pp, low confidence
46Ornith-1.5-9B54.4%measured
47DeepSeek V3 032453.9%estimated ± 2.6 pp, low confidence
48Ornith-1.0-9B52.0%measured
49GPT-4o43.0%estimated ± 2.6 pp, low confidence
50Granite 4.2 30B41.9%measured
51Nemotron 3.5 Lightning 30B A3B NVFP436.5%measured
52Phi-432.0%estimated ± 2.6 pp, low confidence
53Granite 4.2 8B30.8%measured
54LLaDA2.2-flash25.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General