benchgap
OpenAI · model

GPT-5.6 Sol benchmark scores

As of 2026-10-07, GPT-5.6 Sol (OpenAI) has measured scores on 52 benchmarks and estimated scores on 76 more.

BenchmarkScoreSource
AA-GPQA Diamond94.1%measured
AA-HLE49.5%measured
AA-SciCode57.1%measured
AIME26100.0%estimated ± 0.6 pp, low confidence
Artificial Analysis Intelligence Index58.9%measured
CritPt32.3%measured
GDPval-AA55.6%measured
GPQA Diamond94.6%measured
HLE60.7%estimated ± 5.5 pp, low confidence
IFBench71.2%estimated ± 6.9 pp, medium confidence
AA-LCR84.0%measured
LiveCodeBench v691.6%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy59.4%measured
SciCode41.9%estimated ± 2.9 pp, low confidence
Terminal-Bench 2.191.9%measured
BrowseComp92.2%measured
HLE w/ tools59.3%estimated ± 4.6 pp, medium confidence
IFEval93.5%estimated ± 1.3 pp, high confidence
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench46.6%estimated ± 9.9 pp, low confidence
τ²-bench results85.1%measured
AA Coding Index77.4%measured
AA-MMMU-Pro83.4%measured
APEX-Agents44.7%estimated ± 10.0 pp, low confidence
APEX-Agents-AA38.7%estimated ± 2.9 pp, low confidence
BioMysteryBench (human-difficult)49.2%estimated ± 5.9 pp, low confidence
DeepSearchQA93.4%estimated ± 4.5 pp, high confidence
SWE-bench Verified85.7%estimated ± 2.5 pp, high confidence
AutomationBench45.2%estimated ± 5.8 pp, medium confidence
BFCL v477.9%estimated ± 2.6 pp, medium confidence
CyberGym84.5%measured
JobBench65.0%estimated ± 4.9 pp, medium confidence
SWE-bench Pro64.6%measured
τ³-bench results72.9%estimated ± 2.1 pp, low confidence
WideResearch82.8%estimated ± 4.6 pp, high confidence
AA Agentic Index50.5%measured
MMLU-Pro87.4%estimated ± 3.0 pp, medium confidence
FrontierMath v2 (Tier 4)83.0%measured
FrontierMath v2 (Tiers 1-3)89.0%measured
GPQA94.6%measured
AA-IFBench72.7%measured
Gert Labs75.5%estimated ± 3.0 pp, low confidence
AA-AnalystAgent47.5%measured
AA EnterpriseOps-Gym51.0%estimated ± 1.8 pp, medium confidence
AA Harvey LAB93.5%estimated ± 1.2 pp, medium confidence
ApprenticeBench26.0%measured
ARC-AGI-196.5%measured
ARC-AGI-292.5%measured
CursorBench 3.161.5%estimated ± 3.4 pp, medium confidence
CursorBench 3.267.2%measured
Terminal-Bench 3.034.6%measured
FrontierCode 1.1 Main50.5%estimated ± 1.6 pp, medium confidence
FrontierSWE v232.2%measured
OfficeQA Pro67.7%estimated ± 7.2 pp, medium confidence
OSWorld-Verified82.2%estimated ± 1.9 pp, medium confidence
Vals GPQA Diamond95.2%measured
Vals LiveCodeBench82.6%measured
Vals MMLU-Pro89.1%measured
Vals SWE-bench96.2%measured
Terminal-Bench 2.1 (Vals AI)85.8%measured
VulcanBench v387.0%measured
AA AutomationBench65.6%estimated ± 5.5 pp, low confidence
GDP.pdf24.4%estimated ± 3.8 pp, high confidence
AA ITBench56.2%measured
AA Tau3 Banking44.1%estimated ± 3.0 pp, low confidence
AA Terminal-Bench 2.184.9%estimated ± 3.5 pp, medium confidence
AA Terminal-Bench 4.033.8%estimated ± 8.9 pp, low confidence
CursorBench 4.041.7%measured
CWE-bench v159.4%estimated ± 6.9 pp, medium confidence
DeepSWE72.7%measured
HLE w/o tools46.6%estimated ± 4.4 pp, high confidence
OSWorld 2.062.6%measured
PostTrainBench v1.136.2%measured
ProgramBench90.9%estimated ± 4.8 pp, medium confidence
Toolathlon-Verified79.5%estimated ± 1.0 pp, medium confidence
Vibe Code Bench77.7%estimated ± 10.3 pp, low confidence
CharXiv86.2%estimated ± 5.4 pp, medium confidence
CharXiv w/o tools87.7%estimated ± 1.8 pp, low confidence
ExploitBench73.5%measured
ExploitGym33.7%measured
C-Eval95.6%estimated ± 0.9 pp, low confidence
Claw-Eval81.7%estimated ± 7.9 pp, low confidence
HMMT Nov 202593.2%estimated ± 2.6 pp, low confidence
MathVision95.6%estimated ± 3.6 pp, medium confidence
MCP Atlas86.3%estimated ± 3.5 pp, low confidence
MCP-Tasks80.4%estimated ± 7.0 pp, low confidence
MMAnswerBench100.0%estimated ± 1.3 pp, low confidence
MMLU-Redux97.8%estimated ± 1.1 pp, low confidence
MMMU-Pro83.0%measured
NL2Repo60.1%estimated ± 4.7 pp, high confidence
QwenClawBench100.0%estimated ± 6.0 pp, low confidence
ScreenSpot Pro85.3%estimated ± 10.0 pp, low confidence
SuperGPQA88.8%estimated ± 7.5 pp, low confidence
Terminal-Bench 2.083.2%estimated ± 5.9 pp, low confidence
Toolathlon58.0%measured
VideoMMMU89.0%estimated ± 1.0 pp, medium confidence
ERQA68.8%estimated ± 3.9 pp, medium confidence
HealthBench Hard33.1%measured
LiveCodeBench Pro87.2%estimated ± 6.0 pp, low confidence
MedXpertQA (MM)80.6%estimated ± 2.4 pp, high confidence
MedXpertQA (Text)70.7%estimated ± 4.5 pp, low confidence
MMLU-Pro (Arcee)88.4%estimated ± 3.4 pp, low confidence
React Native Evals100.0%estimated ± 2.4 pp, low confidence
ResearchClawBench21.0%estimated ± 2.0 pp, medium confidence
SWE-Rebench58.1%estimated ± 8.9 pp, low confidence
ARC-AGI-37.8%measured
FrontierMath (legacy)89.0%measured
BioMysteryBench (human-solvable)89.5%estimated ± 0.6 pp, low confidence
DRACO84.4%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended60.6%measured
HealthBench (raw)57.4%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)53.9%estimated ± 0.9 pp, medium confidence
HealthBench Professional60.5%measured
HealthBench Professional (raw)67.2%estimated ± 5.0 pp, medium confidence
HLE-Verified54.5%measured
LABBench282.1%measured
MMMU90.3%estimated ± 0.9 pp, medium confidence
LiveCodeBench100.0%estimated ± 8.9 pp, low confidence
Agents' Last Exam28.8%estimated ± 2.1 pp, high confidence
OpenHarmony Bench58.8%estimated ± 2.4 pp, high confidence
SEC-Bench Pro71.2%measured
SimpleVQA69.8%estimated ± 8.2 pp, medium confidence
MMMLU91.2%estimated ± 1.1 pp, low confidence
MMLU96.0%estimated ± 1.1 pp, low confidence
MMMU-Pro w/ Python84.6%measured
RealWorldQA89.3%estimated ± 1.2 pp, low confidence
Video-MME (with subtitle)90.0%estimated ± 1.8 pp, low confidence
OmniDocBench 1.591.7%estimated ± 5.9 pp, low confidence