benchgap
Alibaba (Qwen) · model

Qwen3.7 Max benchmark scores

As of 2026-10-07, Qwen3.7 Max (Alibaba (Qwen)) has measured scores on 46 benchmarks and estimated scores on 66 more.

BenchmarkScoreSource
AA-GPQA Diamond92.3%measured
AA-HLE40.5%measured
AA-SciCode49.5%measured
AIME2697.3%estimated ± 1.3 pp, medium confidence
Artificial Analysis Intelligence Index29.5%measured
CritPt13.4%measured
GDPval-AA31.6%measured
GPQA Diamond92.4%measured
HLE41.4%measured
IFBench79.1%measured
AA-LCR79.0%measured
LiveCodeBench v689.0%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy31.1%measured
SciCode53.5%measured
Terminal-Bench 2.178.5%estimated ± 6.9 pp, medium confidence
BrowseComp81.1%estimated ± 5.7 pp, medium confidence
HLE w/ tools53.5%measured
IFEval94.3%measured
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench47.9%measured
τ²-bench results94.7%measured
AA Coding Index66.0%measured
APEX-Agents31.0%estimated ± 0.6 pp, medium confidence
APEX-Agents-AA34.8%estimated ± 5.7 pp, medium confidence
BioMysteryBench (human-difficult)35.7%estimated ± 5.9 pp, low confidence
DeepSearchQA86.6%estimated ± 4.5 pp, high confidence
SWE-bench Verified80.4%measured
AutomationBench28.4%estimated ± 9.7 pp, low confidence
BFCL v475.0%measured
CyberGym78.1%estimated ± 2.4 pp, medium confidence
JobBench46.7%estimated ± 6.8 pp, medium confidence
SWE-bench Pro60.6%measured
τ³-bench results69.6%estimated ± 1.8 pp, low confidence
WideResearch80.6%estimated ± 3.4 pp, medium confidence
AA Agentic Index23.9%measured
MMLU-Pro89.6%measured
FrontierMath v2 (Tiers 1-3)39.0%estimated ± 8.4 pp, low confidence
GPQA92.4%measured
AA-IFBench80.5%measured
Gert Labs64.3%measured
AA-AnalystAgent44.3%estimated ± 2.5 pp, medium confidence
AA EnterpriseOps-Gym46.0%estimated ± 3.6 pp, medium confidence
AA Harvey LAB83.1%estimated ± 1.2 pp, medium confidence
ApprenticeBench7.0%estimated ± 3.1 pp, medium confidence
ARC-AGI-192.6%estimated ± 2.7 pp, high confidence
ARC-AGI-267.7%estimated ± 10.1 pp, low confidence
CursorBench 3.142.8%estimated ± 3.4 pp, low confidence
CursorBench 3.258.9%estimated ± 3.6 pp, high confidence
Terminal-Bench 3.06.3%estimated ± 6.9 pp, low confidence
FrontierCode 1.1 Main26.5%estimated ± 2.7 pp, medium confidence
FrontierSWE v216.2%estimated ± 9.0 pp, medium confidence
OSWorld-Verified74.0%estimated ± 5.9 pp, medium confidence
Vals GPQA Diamond90.2%measured
Vals LiveCodeBench87.1%measured
Vals MMLU-Pro89.3%measured
Vals SWE-bench68.8%measured
Terminal-Bench 2.1 (Vals AI)61.0%measured
VulcanBench v385.1%estimated ± 5.6 pp, low confidence
AA AutomationBench6.8%estimated ± 7.0 pp, medium confidence
GDP.pdf9.4%estimated ± 5.4 pp, medium confidence
AA ITBench53.1%estimated ± 3.4 pp, low confidence
AA Tau3 Banking22.0%estimated ± 5.8 pp, medium confidence
AA Terminal-Bench 2.177.8%estimated ± 4.4 pp, high confidence
AA Terminal-Bench 4.014.8%estimated ± 14.0 pp, low confidence
CursorBench 4.028.1%estimated ± 1.6 pp, medium confidence
CWE-bench v141.4%estimated ± 6.9 pp, medium confidence
DeepSWE46.6%estimated ± 6.4 pp, low confidence
HLE w/o tools39.6%estimated ± 2.9 pp, high confidence
OSWorld 2.010.6%estimated ± 4.5 pp, medium confidence
PostTrainBench v1.117.3%estimated ± 2.7 pp, high confidence
SWE Multilingual78.3%measured
Toolathlon-Verified53.2%estimated ± 2.3 pp, low confidence
Vibe Code Bench50.6%estimated ± 8.1 pp, medium confidence
ExploitGym0.0%estimated ± 12.2 pp, low confidence
C-Eval93.9%estimated ± 0.7 pp, low confidence
Claw-Eval65.2%measured
DeepPlanning100.0%estimated ± 9.1 pp, low confidence
HMMT Feb 2025100.0%estimated ± 1.8 pp, low confidence
HMMT Feb 202697.1%measured
MCP Atlas76.4%measured
MCP-Tasks77.0%estimated ± 0.6 pp, low confidence
MMAnswerBench88.8%estimated ± 2.8 pp, low confidence
MMLU-ProX87.0%measured
MMLU-Redux95.0%measured
NL2Repo47.2%measured
NOVA-6359.0%measured
QwenClawBench64.3%measured
SuperGPQA73.6%measured
Terminal-Bench 2.069.7%measured
Toolathlon55.4%estimated ± 6.3 pp, medium confidence
HealthBench Hard32.1%estimated ± 5.1 pp, low confidence
LiveCodeBench Pro84.2%estimated ± 6.0 pp, low confidence
MedXpertQA (Text)61.7%estimated ± 4.5 pp, medium confidence
MMLU-Pro (Arcee)87.7%estimated ± 3.4 pp, low confidence
React Native Evals63.9%estimated ± 2.4 pp, low confidence
ResearchClawBench18.7%measured
SWE-Rebench61.8%estimated ± 3.6 pp, medium confidence
ARC-AGI-30.1%estimated ± 2.1 pp, high confidence
BioMysteryBench (human-solvable)86.4%estimated ± 0.6 pp, low confidence
DRACO74.5%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended14.5%estimated ± 2.4 pp, low confidence
HealthBench (raw)49.5%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)53.9%estimated ± 3.7 pp, low confidence
HealthBench Professional59.9%estimated ± 1.3 pp, medium confidence
HealthBench Professional (raw)59.9%estimated ± 5.0 pp, medium confidence
HLE-Verified49.9%estimated ± 2.0 pp, medium confidence
LABBench282.7%estimated ± 1.8 pp, low confidence
LiveCodeBench91.6%measured
OpenHarmony Bench53.4%measured
IMOAnswerBench90.0%measured
MMMLU90.3%measured
MMLU91.2%estimated ± 1.1 pp, medium confidence