benchgap
OpenAI · model

GPT-5.6 Terra benchmark scores

As of 2026-10-07, GPT-5.6 Terra (OpenAI) has measured scores on 49 benchmarks and estimated scores on 79 more.

BenchmarkScoreSource
AA-GPQA Diamond92.5%measured
AA-HLE42.9%measured
AA-SciCode55.0%measured
AIME26100.0%estimated ± 0.6 pp, low confidence
Artificial Analysis Intelligence Index54.9%measured
CritPt30.0%measured
GDPval-AA47.7%measured
GPQA Diamond92.9%measured
HLE58.6%estimated ± 5.5 pp, low confidence
IFBench69.7%estimated ± 6.9 pp, medium confidence
AA-LCR83.0%measured
LiveCodeBench v691.1%estimated ± 2.1 pp, high confidence
AA-Omniscience Accuracy46.8%measured
SciCode48.5%estimated ± 2.9 pp, medium confidence
Terminal-Bench 2.187.4%measured
BrowseComp87.5%measured
HLE w/ tools58.7%estimated ± 4.6 pp, high confidence
IFEval93.5%estimated ± 1.3 pp, high confidence
LongBench v261.5%estimated ± 5.9 pp, low confidence
VITA-Bench46.0%estimated ± 9.9 pp, low confidence
τ²-bench results86.3%measured
AA Coding Index76.7%measured
AA-MMMU-Pro80.7%measured
APEX-Agents39.6%estimated ± 10.0 pp, low confidence
APEX-Agents-AA38.9%measured
BioMysteryBench (human-difficult)44.2%estimated ± 5.9 pp, low confidence
DeepSearchQA92.4%estimated ± 4.5 pp, high confidence
SWE-bench Verified84.9%estimated ± 2.5 pp, high confidence
AutomationBench28.7%estimated ± 5.8 pp, medium confidence
BFCL v477.3%estimated ± 2.6 pp, medium confidence
CyberGym81.8%measured
JobBench63.3%estimated ± 4.9 pp, medium confidence
SWE-bench Pro63.4%measured
τ³-bench results71.8%estimated ± 2.1 pp, low confidence
WideResearch81.0%estimated ± 4.6 pp, high confidence
AA Agentic Index43.7%measured
MMLU-Pro87.0%estimated ± 3.0 pp, medium confidence
FrontierMath v2 (Tier 4)68.3%measured
FrontierMath v2 (Tiers 1-3)84.9%measured
GPQA92.9%measured
AA-IFBench71.2%measured
Gert Labs69.7%estimated ± 3.0 pp, medium confidence
AA-AnalystAgent54.4%estimated ± 5.5 pp, medium confidence
AA EnterpriseOps-Gym31.8%estimated ± 3.6 pp, medium confidence
AA Harvey LAB92.9%estimated ± 1.2 pp, medium confidence
ApprenticeBench16.0%measured
ARC-AGI-196.5%measured
ARC-AGI-283.9%measured
CursorBench 3.156.3%estimated ± 3.4 pp, medium confidence
CursorBench 3.264.9%measured
Terminal-Bench 3.020.8%measured
FrontierCode 1.1 Main47.9%estimated ± 1.6 pp, medium confidence
FrontierSWE v227.1%estimated ± 7.6 pp, medium confidence
OfficeQA Pro62.0%estimated ± 7.2 pp, medium confidence
OSWorld-Verified78.0%estimated ± 1.9 pp, medium confidence
Vals GPQA Diamond90.9%measured
Vals LiveCodeBench85.9%measured
Vals MMLU-Pro86.7%measured
Vals SWE-bench95.4%measured
Terminal-Bench 2.1 (Vals AI)77.5%measured
VulcanBench v387.0%measured
AA AutomationBench62.7%estimated ± 5.5 pp, low confidence
GDP.pdf22.9%estimated ± 4.4 pp, low confidence
AA ITBench51.0%measured
AA Tau3 Banking45.6%estimated ± 3.0 pp, low confidence
AA Terminal-Bench 2.184.9%estimated ± 3.5 pp, high confidence
AA Terminal-Bench 4.027.8%estimated ± 8.9 pp, medium confidence
CursorBench 4.041.3%measured
CWE-bench v154.3%estimated ± 6.9 pp, medium confidence
DeepSWE69.6%measured
HLE w/o tools43.5%estimated ± 4.4 pp, high confidence
OSWorld 2.050.2%measured
PostTrainBench v1.134.4%estimated ± 2.7 pp, high confidence
ProgramBench83.2%estimated ± 6.0 pp, low confidence
Toolathlon-Verified78.7%estimated ± 1.0 pp, medium confidence
Vibe Code Bench74.5%estimated ± 10.3 pp, low confidence
CharXiv84.0%estimated ± 5.4 pp, medium confidence
CharXiv w/o tools85.2%estimated ± 1.8 pp, medium confidence
ExploitBench52.9%measured
ExploitGym23.2%measured
C-Eval94.7%estimated ± 0.9 pp, low confidence
Claw-Eval81.7%estimated ± 7.9 pp, low confidence
HMMT Nov 202593.2%estimated ± 2.6 pp, low confidence
MathVision91.2%estimated ± 3.6 pp, high confidence
MCP Atlas82.6%estimated ± 3.5 pp, medium confidence
MCP-Tasks78.2%estimated ± 7.0 pp, low confidence
MMAnswerBench97.4%estimated ± 1.3 pp, low confidence
MMLU-Redux97.2%estimated ± 1.1 pp, low confidence
MMMU-Pro80.7%measured
NL2Repo59.2%estimated ± 4.7 pp, high confidence
QwenClawBench100.0%estimated ± 6.0 pp, low confidence
ScreenSpot Pro79.5%estimated ± 10.0 pp, low confidence
SuperGPQA84.4%estimated ± 7.5 pp, low confidence
Terminal-Bench 2.078.3%estimated ± 5.9 pp, low confidence
Toolathlon53.1%measured
VideoMMMU87.3%estimated ± 1.0 pp, high confidence
ERQA68.5%estimated ± 3.9 pp, high confidence
HealthBench Hard32.7%measured
LiveCodeBench Pro86.3%estimated ± 6.0 pp, low confidence
MedXpertQA (MM)76.0%estimated ± 2.4 pp, high confidence
MedXpertQA (Text)63.5%estimated ± 4.5 pp, medium confidence
MMLU-Pro (Arcee)87.8%estimated ± 3.4 pp, low confidence
React Native Evals100.0%estimated ± 2.4 pp, low confidence
ResearchClawBench20.5%estimated ± 2.0 pp, medium confidence
SWE-Rebench58.1%estimated ± 8.9 pp, low confidence
ARC-AGI-30.8%measured
FrontierMath (legacy)84.9%measured
BioMysteryBench (human-solvable)89.5%estimated ± 0.6 pp, medium confidence
DRACO81.1%estimated ± 3.0 pp, medium confidence
FrontierCode 1.1 Extended55.8%measured
HealthBench (raw)51.7%estimated ± 6.4 pp, low confidence
HealthBench (length-adjusted)53.8%estimated ± 0.9 pp, medium confidence
HealthBench Professional57.7%measured
HealthBench Professional (raw)61.9%estimated ± 5.0 pp, medium confidence
HLE-Verified51.1%measured
LABBench281.2%measured
MMMU87.9%estimated ± 0.9 pp, medium confidence
LiveCodeBench100.0%estimated ± 8.9 pp, low confidence
Agents' Last Exam24.2%estimated ± 2.1 pp, high confidence
OpenHarmony Bench58.8%estimated ± 2.4 pp, high confidence
SEC-Bench Pro67.0%estimated ± 4.3 pp, medium confidence
SimpleVQA68.5%estimated ± 8.2 pp, medium confidence
MMMLU90.8%estimated ± 1.1 pp, low confidence
MMLU94.5%estimated ± 1.1 pp, low confidence
MMMU-Pro w/ Python82.0%measured
RealWorldQA88.0%estimated ± 1.2 pp, low confidence
Video-MME (with subtitle)88.8%estimated ± 1.8 pp, medium confidence
OmniDocBench 1.591.7%estimated ± 5.9 pp, low confidence