benchgap
OpenAI · model

GPT-5.6 Luna benchmark scores

As of 2026-10-07, GPT-5.6 Luna (OpenAI) has measured scores on 43 benchmarks and estimated scores on 82 more.

BenchmarkScoreSource
AA-GPQA Diamond91.1%measured
AA-HLE39.5%measured
AA-SciCode53.6%measured
AIME26100.0%estimated ± 0.6 pp, low confidence
Artificial Analysis Intelligence Index51.2%measured
CritPt20.6%measured
GDPval-AA48.2%measured
GPQA Diamond92.3%measured
HLE51.6%estimated ± 5.5 pp, low confidence
AA-LCR83.7%measured
LiveCodeBench v690.8%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy42.7%measured
SciCode53.2%estimated ± 3.2 pp, high confidence
Terminal-Bench 2.184.7%measured
BrowseComp83.3%measured
HLE w/ tools57.0%estimated ± 4.6 pp, high confidence
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench45.3%estimated ± 9.9 pp, low confidence
τ²-bench results95.4%estimated ± 7.3 pp, medium confidence
AA Coding Index71.5%measured
AA-MMMU-Pro78.6%measured
APEX-Agents39.9%estimated ± 10.0 pp, low confidence
APEX-Agents-AA35.8%measured
BioMysteryBench (human-difficult)42.3%estimated ± 5.9 pp, low confidence
DeepSearchQA92.2%estimated ± 4.5 pp, high confidence
SWE-bench Verified84.4%estimated ± 2.5 pp, high confidence
AutomationBench28.4%estimated ± 5.8 pp, medium confidence
BFCL v477.3%estimated ± 2.6 pp, medium confidence
CyberGym77.9%measured
JobBench62.5%estimated ± 4.9 pp, medium confidence
SWE-bench Pro62.7%measured
τ³-bench results71.9%estimated ± 2.1 pp, low confidence
WideResearch79.2%estimated ± 4.6 pp, high confidence
AA Agentic Index42.7%measured
MMLU-Pro86.9%estimated ± 3.0 pp, high confidence
FrontierMath v2 (Tier 4)58.5%measured
FrontierMath v2 (Tiers 1-3)78.6%measured
GPQA92.3%measured
Gert Labs64.5%estimated ± 3.0 pp, medium confidence
AA-AnalystAgent54.4%estimated ± 5.5 pp, medium confidence
AA EnterpriseOps-Gym44.5%estimated ± 6.7 pp, low confidence
AA Harvey LAB92.7%estimated ± 1.2 pp, medium confidence
ApprenticeBench7.0%measured
ARC-AGI-188.0%measured
ARC-AGI-259.5%measured
CursorBench 3.152.9%estimated ± 3.4 pp, medium confidence
CursorBench 3.261.1%measured
Terminal-Bench 3.014.3%measured
FrontierCode 1.1 Main43.9%estimated ± 1.6 pp, medium confidence
FrontierSWE v214.4%estimated ± 7.6 pp, low confidence
OfficeQA Pro50.8%estimated ± 7.2 pp, medium confidence
OSWorld-Verified74.2%estimated ± 1.9 pp, medium confidence
Vals GPQA Diamond91.7%measured
Vals LiveCodeBench84.0%estimated ± 2.7 pp, low confidence
Vals MMLU-Pro86.0%measured
Vals SWE-bench93.0%measured
Terminal-Bench 2.1 (Vals AI)79.0%measured
VulcanBench v385.5%measured
AA AutomationBench59.6%estimated ± 5.5 pp, low confidence
GDP.pdf22.0%estimated ± 4.4 pp, low confidence
AA ITBench46.3%estimated ± 3.9 pp, low confidence
AA Tau3 Banking47.4%estimated ± 5.8 pp, medium confidence
AA Terminal-Bench 2.184.9%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.024.3%estimated ± 8.9 pp, medium confidence
CursorBench 4.035.9%measured
CWE-bench v154.6%estimated ± 6.9 pp, medium confidence
DeepSWE67.2%measured
HLE w/o tools42.1%estimated ± 4.4 pp, high confidence
OSWorld 2.045.6%measured
PostTrainBench v1.133.1%estimated ± 3.3 pp, high confidence
ProgramBench77.6%estimated ± 6.0 pp, low confidence
Toolathlon-Verified78.3%estimated ± 1.0 pp, medium confidence
Vibe Code Bench56.5%estimated ± 10.3 pp, low confidence
CharXiv81.5%estimated ± 5.4 pp, medium confidence
CharXiv w/o tools82.7%estimated ± 1.8 pp, medium confidence
ExploitBench33.2%measured
ExploitGym12.4%measured
C-Eval94.4%estimated ± 0.9 pp, low confidence
Claw-Eval68.5%estimated ± 7.9 pp, medium confidence
HMMT Nov 202593.2%estimated ± 2.6 pp, low confidence
MathVision86.9%estimated ± 3.6 pp, high confidence
MCP Atlas78.7%estimated ± 7.8 pp, low confidence
MCP-Tasks78.3%estimated ± 7.0 pp, low confidence
MMAnswerBench95.1%estimated ± 1.3 pp, low confidence
MMLU-Redux96.9%estimated ± 1.1 pp, low confidence
MMMU-Pro78.4%measured
NL2Repo56.7%estimated ± 4.7 pp, high confidence
QwenClawBench100.0%estimated ± 6.0 pp, low confidence
ScreenSpot Pro74.0%estimated ± 10.0 pp, low confidence
SuperGPQA82.5%estimated ± 7.5 pp, medium confidence
Terminal-Bench 2.079.2%estimated ± 5.9 pp, low confidence
Toolathlon53.4%measured
VideoMMMU85.1%estimated ± 1.0 pp, high confidence
ERQA67.9%estimated ± 3.9 pp, high confidence
HealthBench Hard32.0%measured
LiveCodeBench Pro85.8%estimated ± 6.0 pp, low confidence
MedXpertQA (MM)71.1%estimated ± 2.4 pp, high confidence
MedXpertQA (Text)61.3%estimated ± 4.5 pp, medium confidence
MMLU-Pro (Arcee)87.6%estimated ± 3.4 pp, low confidence
React Native Evals100.0%estimated ± 2.4 pp, low confidence
ResearchClawBench20.3%estimated ± 2.0 pp, medium confidence
SWE-Rebench58.1%estimated ± 8.9 pp, low confidence
ARC-AGI-30.2%measured
FrontierMath (legacy)78.6%measured
BioMysteryBench (human-solvable)89.2%estimated ± 0.6 pp, medium confidence
DRACO81.3%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended55.1%measured
HealthBench (raw)48.6%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)53.8%estimated ± 0.9 pp, medium confidence
HealthBench Professional55.7%measured
HealthBench Professional (raw)59.0%estimated ± 5.0 pp, medium confidence
HLE-Verified35.3%estimated ± 0.7 pp, low confidence
LABBench267.6%estimated ± 1.3 pp, low confidence
MMMU86.0%estimated ± 0.9 pp, medium confidence
LiveCodeBench100.0%estimated ± 8.9 pp, low confidence
Agents' Last Exam24.0%estimated ± 2.1 pp, high confidence
OpenHarmony Bench58.7%estimated ± 2.4 pp, high confidence
SEC-Bench Pro54.9%estimated ± 4.3 pp, medium confidence
SimpleVQA67.2%estimated ± 8.2 pp, medium confidence
MMMLU90.6%estimated ± 1.1 pp, medium confidence
MMLU93.9%estimated ± 1.1 pp, low confidence
MMMU-Pro w/ Python79.5%measured
RealWorldQA86.9%estimated ± 1.2 pp, medium confidence
Video-MME (with subtitle)87.7%estimated ± 1.8 pp, medium confidence
OmniDocBench 1.591.7%estimated ± 5.9 pp, low confidence