benchgap
DeepSeek · model

DeepSeek V4 Pro 0813 benchmark scores

As of 2026-10-07, DeepSeek V4 Pro 0813 (DeepSeek) has measured scores on 44 benchmarks and estimated scores on 69 more.

BenchmarkScoreSource
AA-GPQA Diamond92.8%measured
AA-HLE41.0%measured
AA-SciCode51.0%measured
AIME2696.9%estimated ± 1.3 pp, medium confidence
Artificial Analysis Intelligence Index53.2%measured
CritPt18.0%measured
GDPval-AA54.5%measured
GPQA Diamond90.1%measured
HLE42.7%measured
IFBench75.1%estimated ± 6.9 pp, medium confidence
AA-LCR80.3%measured
LiveCodeBench v687.0%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy49.1%measured
SciCode51.7%estimated ± 2.9 pp, medium confidence
Terminal-Bench 2.187.9%measured
BrowseComp83.4%measured
HLE w/ tools60.0%measured
IFEval93.7%estimated ± 1.3 pp, high confidence
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench45.6%estimated ± 9.9 pp, low confidence
τ²-bench results96.2%measured
AA Coding Index68.8%measured
APEX-Agents28.7%estimated ± 0.6 pp, medium confidence
APEX-Agents-AA24.3%measured
BioMysteryBench (human-difficult)45.2%estimated ± 5.9 pp, low confidence
DeepSearchQA93.3%estimated ± 4.5 pp, high confidence
SWE-bench Verified80.6%measured
AutomationBench31.8%measured
BFCL v477.8%estimated ± 2.6 pp, medium confidence
CyberGym83.3%measured
JobBench58.3%estimated ± 3.4 pp, low confidence
SWE-bench Pro55.4%measured
τ³-bench results69.6%estimated ± 1.8 pp, low confidence
WideResearch84.2%estimated ± 3.4 pp, low confidence
AA Agentic Index49.6%measured
MMLU-Pro87.5%measured
FrontierMath v2 (Tiers 1-3)39.0%estimated ± 8.4 pp, low confidence
GPQA90.1%measured
AA-IFBench76.5%measured
Gert Labs69.2%estimated ± 6.0 pp, low confidence
AA-AnalystAgent53.9%estimated ± 2.5 pp, medium confidence
AA EnterpriseOps-Gym49.6%measured
AA Harvey LAB93.4%estimated ± 1.2 pp, medium confidence
ApprenticeBench22.8%estimated ± 4.0 pp, medium confidence
ARC-AGI-190.0%measured
ARC-AGI-261.3%measured
CursorBench 3.146.5%estimated ± 3.4 pp, low confidence
CursorBench 3.251.1%estimated ± 3.6 pp, high confidence
Terminal-Bench 3.03.3%estimated ± 6.9 pp, low confidence
FrontierCode 1.1 Main27.1%estimated ± 2.7 pp, medium confidence
FrontierSWE v26.9%estimated ± 9.0 pp, medium confidence
OSWorld-Verified79.7%estimated ± 4.7 pp, high confidence
Vals GPQA Diamond92.4%measured
Vals LiveCodeBench87.5%measured
Vals MMLU-Pro87.0%measured
Vals SWE-bench96.4%measured
Terminal-Bench 2.1 (Vals AI)54.7%measured
VulcanBench v385.4%estimated ± 5.6 pp, low confidence
AA AutomationBench20.6%estimated ± 5.7 pp, low confidence
GDP.pdf13.0%estimated ± 3.4 pp, medium confidence
AA ITBench47.4%estimated ± 3.4 pp, medium confidence
AA Tau3 Banking47.5%estimated ± 5.8 pp, medium confidence
AA Terminal-Bench 2.184.9%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.028.5%estimated ± 8.9 pp, medium confidence
CursorBench 4.031.2%estimated ± 1.6 pp, medium confidence
CWE-bench v158.8%estimated ± 6.9 pp, medium confidence
DeepSWE62.7%measured
HLE w/o tools34.6%estimated ± 2.9 pp, high confidence
OSWorld 2.019.4%estimated ± 5.5 pp, low confidence
PostTrainBench v1.134.5%estimated ± 2.7 pp, high confidence
SWE Multilingual76.2%measured
Toolathlon-Verified74.1%measured
Vibe Code Bench49.9%measured
ExploitGym10.4%estimated ± 6.1 pp, low confidence
C-Eval93.2%estimated ± 0.8 pp, low confidence
Claw-Eval69.1%estimated ± 5.7 pp, medium confidence
DeepPlanning47.0%estimated ± 13.1 pp, low confidence
HMMT Feb 202599.6%estimated ± 1.8 pp, low confidence
HMMT Feb 202695.2%measured
MCP Atlas73.6%measured
MCP-Tasks77.0%estimated ± 0.6 pp, low confidence
MMAnswerBench87.8%estimated ± 2.8 pp, low confidence
MMLU-ProX85.2%estimated ± 1.7 pp, medium confidence
MMLU-Redux94.4%estimated ± 0.7 pp, high confidence
NL2Repo61.5%measured
NOVA-6357.7%estimated ± 1.6 pp, low confidence
QwenClawBench61.5%estimated ± 2.6 pp, high confidence
SuperGPQA85.3%estimated ± 7.5 pp, low confidence
Terminal-Bench 2.067.9%measured
Toolathlon51.8%measured
HealthBench Hard2.4%estimated ± 5.1 pp, low confidence
LiveCodeBench Pro80.0%estimated ± 6.0 pp, low confidence
MedXpertQA (Text)54.1%estimated ± 4.5 pp, medium confidence
MMLU-Pro (Arcee)86.9%estimated ± 3.4 pp, low confidence
React Native Evals100.0%estimated ± 2.4 pp, low confidence
ResearchClawBench18.5%estimated ± 1.8 pp, medium confidence
SWE-Rebench61.8%estimated ± 3.6 pp, medium confidence
ARC-AGI-30.0%estimated ± 2.1 pp, medium confidence
BioMysteryBench (human-solvable)88.8%estimated ± 0.6 pp, medium confidence
DRACO83.9%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended61.1%estimated ± 2.4 pp, medium confidence
HealthBench (raw)50.0%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)55.1%estimated ± 2.5 pp, low confidence
HealthBench Professional58.3%estimated ± 1.3 pp, medium confidence
HealthBench Professional (raw)60.3%estimated ± 5.0 pp, medium confidence
HLE-Verified35.3%estimated ± 0.7 pp, low confidence
LABBench271.4%estimated ± 1.3 pp, low confidence
LiveCodeBench100.0%estimated ± 8.9 pp, low confidence
Agents' Last Exam25.7%measured
OpenHarmony Bench59.0%measured
IMOAnswerBench89.8%measured
MMMLU89.9%estimated ± 1.1 pp, medium confidence
MMLU94.8%estimated ± 1.1 pp, low confidence