benchgap
Harness tax

The same benchmark, measured differently

The same benchmark, run under different harnesses or protocols, disagrees about the same models - on the agentic benchmarks by far more than on the tool-free ones. Measured scores only: no estimate enters this page.

Pooled mean |delta| by tier - agentic: 6.9 pp · knowledge_tool_free: 2.3 pp · protocol_layer: 8.5 pp; verified families only, the agentic vs tool-free ratio is 3.7x.

PairModelsMean |Δ|Kendall τDirection
chartography (published) vs chartographywithtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · chartography
335.5 pp0.330 up / 3 down
aa-automation-bench (artificial-analysis) vs automationbench (published)
untiered · cross_harness · weak_alignment · candidate family · automationbench
1319.7 pp0.1513 up / 0 down
riemannbench (published) vs riemannbenchwithtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · riemannbench
119.0 pp—0 up / 1 down
terminalbench21 (published) vs vals-terminal-bench21 (vals-ai)
agentic · cross_harness · verified · terminal-bench-2-1
2912.1 pp0.5229 up / 0 down
hlenotools (published) vs hlewithtools (published)
protocol_layer · protocol_variant · verified · hle-protocol-variants
1110.0 pp0.810 up / 11 down
vals-terminal-bench21 (vals-ai) vs aa-terminal-bench21 (artificial-analysis)
agentic · cross_harness · verified · terminal-bench-2-1
119.8 pp0.880 up / 11 down
hle (published) vs aa-hle (artificial-analysis)
protocol_layer · cross_harness · needs_audit · hle
488.2 pp0.5828 up / 18 down
livecodebench-pro (published) vs valslivecodebench (vals-ai)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
27.9 pp1.000 up / 2 down
valslivecodebench (vals-ai) vs aa-live-code-bench (artificial-analysis)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
17.2 pp—0 up / 1 down
arxivmathaugust2026 (published) vs arxivmathaugust2026withtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · arxivmathaugust2026
27.1 pp1.000 up / 2 down
charxiv (published) vs charxivnotools (published)
untiered · protocol_variant · weak_alignment · candidate family · charxiv
126.5 pp0.6612 up / 0 down
swe-bench-verified (published) vs valsswebench (vals-ai)
agentic · cross_harness · needs_audit · swe-bench-verified
246.3 pp0.6817 up / 4 down
livecodebench-v6 (published) vs livecodebench-pro (published)
agentic · protocol_variant · weak_alignment · candidate family · low overlap · livecodebench
36.1 pp1.003 up / 0 down
livecodebench (published) vs aa-live-code-bench (artificial-analysis)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
14.5 pp—0 up / 1 down
ifbench (published) vs aa-if-bench (artificial-analysis)
knowledge_tool_free · cross_harness · verified · ifbench
114.2 pp0.776 up / 3 down
terminal-bench-4 (published) vs aa-terminal-bench4 (artificial-analysis)
agentic · cross_harness · verified · terminal-bench-4-0
113.9 pp0.828 up / 2 down
livecodebench (published) vs valslivecodebench (vals-ai)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
23.6 pp1.002 up / 0 down
livecodebench-v6 (published) vs valslivecodebench (vals-ai)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
43.3 pp-0.184 up / 0 down
terminalbench21 (published) vs aa-terminal-bench21 (artificial-analysis)
agentic · cross_harness · verified · terminal-bench-2-1
103.3 pp0.907 up / 1 down
vals-gpqa-diamond (vals-ai) vs aa-gpqa-diamond (artificial-analysis)
knowledge_tool_free · cross_harness · verified · gpqa-diamond
472.9 pp0.7715 up / 31 down
mmlu-pro (published) vs mmlu-pro-arcee (published)
knowledge_tool_free · protocol_variant · needs_audit · low overlap · mmlu-pro
32.4 pp-0.330 up / 2 down
gdppdf (published) vs gdppdfwithtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · gdppdf
12.1 pp—0 up / 1 down
scicode (published) vs aa-sci-code (artificial-analysis)
agentic · cross_harness · needs_audit · scicode
202.0 pp0.776 up / 11 down
mmmu-pro (published) vs aa-mmmu-pro (artificial-analysis)
knowledge_tool_free · cross_harness · verified · mmmu-pro
322.0 pp0.7016 up / 11 down
gpqa-diamond (published) vs aa-gpqa-diamond (artificial-analysis)
knowledge_tool_free · cross_harness · verified · gpqa-diamond
402.0 pp0.8121 up / 16 down
mmlu-pro (published) vs vals-mmlu-pro (vals-ai)
knowledge_tool_free · cross_harness · needs_audit · mmlu-pro
71.8 pp0.525 up / 1 down
gpqa-diamond (published) vs vals-gpqa-diamond (vals-ai)
knowledge_tool_free · cross_harness · verified · gpqa-diamond
231.4 pp0.6915 up / 8 down
arxivmathjune2026 (published) vs arxivmathjune2026withtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · arxivmathjune2026
10.5 pp—0 up / 1 down
vals-mmlu-pro (vals-ai) vs mmlu-pro-arcee (published)
knowledge_tool_free · cross_harness · needs_audit · low overlap · mmlu-pro
10.4 pp—0 up / 1 down
benchcadvision2code (published) vs benchcadvision2codewithtools (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · benchcadvision2code
30.3 pp1.000 up / 3 down
aime2025 (published) vs aime2025arcee (published)
untiered · protocol_variant · weak_alignment · candidate family · low overlap · aime2025
10.2 pp—0 up / 1 down
aa-aime2025 (artificial-analysis) vs aime2025 (published)
untiered · cross_harness · weak_alignment · candidate family · low overlap · aime2025
0———
aa-aime2025 (artificial-analysis) vs aime2025arcee (published)
untiered · cross_harness · weak_alignment · candidate family · low overlap · aime2025
0———
aa-gdp-pdf (artificial-analysis) vs gdppdf (published)
untiered · cross_harness · weak_alignment · candidate family · low overlap · gdppdf
0———
aa-gdp-pdf (artificial-analysis) vs gdppdfwithtools (published)
untiered · cross_harness · weak_alignment · candidate family · low overlap · gdppdf
0———
livecodebench (published) vs livecodebench-v6 (published)
agentic · protocol_variant · weak_alignment · candidate family · low overlap · livecodebench
0———
livecodebench (published) vs livecodebench-pro (published)
agentic · protocol_variant · weak_alignment · candidate family · low overlap · livecodebench
0———
livecodebench-v6 (published) vs aa-live-code-bench (artificial-analysis)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
0———
livecodebench-pro (published) vs aa-live-code-bench (artificial-analysis)
agentic · cross_harness · weak_alignment · candidate family · low overlap · livecodebench
0———
aa-math500 (artificial-analysis) vs math-500 (published)
untiered · cross_harness · weak_alignment · candidate family · low overlap · math500
0———
terminal-bench-3 (published) vs terminal-bench3 (published)
agentic · protocol_variant · verified · candidate family · low overlap · terminal-bench-3
0———
terminal-bench-science (published) vs terminal-bench-science-6x-verifier (published)
protocol_layer · protocol_variant · verified · candidate family · low overlap · terminal-bench-science-variants
0———

Measured scores only, never estimates; every per-model delta keeps both scores' retrieval dates and source URLs in the API. Families whose item sets are not verified are flagged and stay out of the headline aggregates; low-overlap pairs are greyed on the interactive page; 23 per-model deltas beyond 20 pp sit in the audit queue.