benchgap
DeepSeek · model

DeepSeek V4 Flash 0731 benchmark scores

As of 2026-10-07, DeepSeek V4 Flash 0731 (DeepSeek) has measured scores on 40 benchmarks and estimated scores on 70 more.

BenchmarkScoreSource
AA-GPQA Diamond90.8%measured
AA-HLE38.6%measured
AA-SciCode50.3%measured
AIME2696.8%estimated ± 1.3 pp, medium confidence
Artificial Analysis Intelligence Index34.3%measured
CritPt16.6%measured
GDPval-AA46.9%measured
GPQA Diamond88.1%measured
HLE34.8%measured
AA-LCR79.7%measured
LiveCodeBench v685.9%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy40.4%measured
SciCode51.3%estimated ± 2.9 pp, medium confidence
Terminal-Bench 2.182.7%measured
BrowseComp73.2%measured
HLE w/ tools45.1%measured
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench43.7%estimated ± 9.9 pp, low confidence
τ²-bench results94.1%estimated ± 13.3 pp, low confidence
AA Coding Index69.1%measured
APEX-Agents25.1%estimated ± 0.6 pp, medium confidence
APEX-Agents-AA18.8%estimated ± 4.6 pp, high confidence
BioMysteryBench (human-difficult)41.1%estimated ± 5.9 pp, low confidence
DeepSearchQA92.1%estimated ± 4.5 pp, high confidence
SWE-bench Verified79.0%measured
AutomationBench25.1%measured
BFCL v477.2%estimated ± 2.6 pp, medium confidence
CyberGym76.7%measured
JobBench50.4%estimated ± 3.4 pp, low confidence
SWE-bench Pro52.6%measured
τ³-bench results69.6%estimated ± 1.8 pp, medium confidence
WideResearch75.0%estimated ± 3.4 pp, medium confidence
AA Agentic Index41.7%measured
MMLU-Pro86.2%measured
FrontierMath v2 (Tiers 1-3)39.0%estimated ± 8.4 pp, low confidence
GPQA88.1%measured
Gert Labs66.8%estimated ± 6.0 pp, low confidence
AA-AnalystAgent17.5%estimated ± 2.5 pp, medium confidence
AA EnterpriseOps-Gym49.4%estimated ± 5.1 pp, low confidence
AA Harvey LAB92.5%estimated ± 1.2 pp, medium confidence
ApprenticeBench6.2%estimated ± 4.0 pp, medium confidence
ARC-AGI-189.0%measured
ARC-AGI-261.4%measured
CursorBench 3.144.7%estimated ± 3.4 pp, low confidence
CursorBench 3.267.8%estimated ± 3.3 pp, medium confidence
Terminal-Bench 3.010.6%estimated ± 6.9 pp, low confidence
FrontierCode 1.1 Main21.8%estimated ± 2.7 pp, low confidence
FrontierSWE v22.0%estimated ± 9.0 pp, low confidence
OSWorld-Verified78.2%estimated ± 4.7 pp, high confidence
Vals GPQA Diamond89.9%measured
Vals LiveCodeBench87.3%measured
Vals MMLU-Pro86.2%measured
Vals SWE-bench88.8%measured
Terminal-Bench 2.1 (Vals AI)67.0%measured
VulcanBench v388.4%measured
AA AutomationBench3.5%estimated ± 5.7 pp, low confidence
GDP.pdf12.8%estimated ± 3.4 pp, medium confidence
AA ITBench60.4%estimated ± 3.4 pp, low confidence
AA Tau3 Banking47.2%estimated ± 5.8 pp, medium confidence
AA Terminal-Bench 2.184.8%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.021.8%estimated ± 8.9 pp, medium confidence
CursorBench 4.031.5%estimated ± 1.6 pp, medium confidence
CWE-bench v153.7%estimated ± 6.9 pp, medium confidence
DeepSWE54.4%measured
HLE w/o tools28.2%estimated ± 2.9 pp, high confidence
OSWorld 2.019.4%estimated ± 5.5 pp, low confidence
PostTrainBench v1.129.8%estimated ± 2.7 pp, high confidence
SWE Multilingual73.3%measured
Toolathlon-Verified70.3%measured
Vibe Code Bench35.7%estimated ± 8.1 pp, medium confidence
ExploitGym0.0%estimated ± 6.1 pp, low confidence
C-Eval93.1%estimated ± 0.8 pp, low confidence
Claw-Eval67.6%estimated ± 5.7 pp, medium confidence
DeepPlanning44.7%estimated ± 13.1 pp, low confidence
HMMT Feb 202599.4%estimated ± 1.8 pp, low confidence
HMMT Feb 202694.8%measured
MCP Atlas69.0%measured
MCP-Tasks76.9%estimated ± 0.6 pp, low confidence
MMAnswerBench87.6%estimated ± 2.8 pp, low confidence
MMLU-ProX84.1%estimated ± 1.7 pp, medium confidence
MMLU-Redux93.7%estimated ± 0.7 pp, high confidence
NL2Repo54.2%measured
NOVA-6356.4%estimated ± 1.6 pp, low confidence
QwenClawBench59.1%estimated ± 2.6 pp, high confidence
SuperGPQA81.4%estimated ± 7.5 pp, medium confidence
Terminal-Bench 2.056.9%measured
Toolathlon47.8%measured
HealthBench Hard0.0%estimated ± 5.1 pp, low confidence
LiveCodeBench Pro77.7%estimated ± 6.0 pp, low confidence
MedXpertQA (Text)48.6%estimated ± 4.5 pp, low confidence
MMLU-Pro (Arcee)86.2%estimated ± 3.4 pp, medium confidence
React Native Evals97.4%estimated ± 2.4 pp, low confidence
ResearchClawBench18.0%estimated ± 1.8 pp, medium confidence
SWE-Rebench61.7%estimated ± 3.6 pp, medium confidence
ARC-AGI-30.0%estimated ± 2.1 pp, medium confidence
BioMysteryBench (human-solvable)88.3%estimated ± 0.6 pp, medium confidence
DRACO80.8%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended46.5%estimated ± 2.4 pp, low confidence
HealthBench (raw)47.8%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)54.7%estimated ± 2.5 pp, low confidence
HealthBench Professional56.3%estimated ± 1.3 pp, medium confidence
HealthBench Professional (raw)58.2%estimated ± 5.0 pp, medium confidence
HLE-Verified35.3%estimated ± 0.7 pp, low confidence
LABBench269.6%estimated ± 1.3 pp, low confidence
LiveCodeBench100.0%estimated ± 8.9 pp, low confidence
Agents' Last Exam25.2%measured
OpenHarmony Bench53.8%measured
IMOAnswerBench88.4%measured
MMMLU89.1%estimated ± 1.1 pp, medium confidence
MMLU93.4%estimated ± 1.1 pp, low confidence