benchgap
Knowledge & reasoning

JevBench 1.4 leaderboard

As of 2026-10-07, the highest measured score on JevBench 1.4 is 70.8% by classifier.dev (fast). 18 more models have estimated scores, calibrated from the benchmarks they were measured on.

Measured scores: benchlm.ai.

#ModelScoreSource
1classifier.dev (fast)70.8%measured
2Imajev-4B67.4%measured
3Plumb-4B65.8%measured
4decider-4b v264.1%measured
5Jev 1.13.063.3%measured
6JevK5 v0.2.062.0%measured
7Cygnet61.8%measured
8Hopper59.4%measured
9JevK5 v0.3 4B56.3%estimated ± 10.7 pp, low confidence
10Winnow-12B Q855.6%measured
11Decision 4B v1.255.4%estimated ± 10.7 pp, low confidence
12Imajev-4B (RTX 5090)55.0%estimated ± 10.7 pp, low confidence
13Decision 4B v1.155.0%estimated ± 10.7 pp, low confidence
14reflex 4B54.0%measured
15Manchego v2.153.6%estimated ± 10.7 pp, low confidence
16djev52.2%measured
17Surogate Rune 26B-A4B v3 (RTX PRO 6000)51.7%estimated ± 10.7 pp, low confidence
18Jev-Omni51.3%measured
19metask-jev-4b47.8%measured
20SemIf Qwen3.5-4B47.7%measured
21Jobe Qwen3.5-4B46.9%measured
22local-jev Qwen3.5-4B46.8%measured
23system-one-open45.1%measured
24spark-s1-4b-v644.6%measured
25Malkuth-4B44.5%measured
26jqv Qwen3-32B44.4%measured
27Qwen3-Reranker-4B43.5%measured
28decider-35b-a3b41.2%measured
29Raw Qwen3 4B Instruct 2507 direct logits41.0%measured
30OpenSourceJev Qwen3.5-4B Q4_K_M40.9%measured
31ZeroEntropy zerank-240.2%measured
32decision-machine-139.9%measured
33Malkuth-2B38.9%measured
34Raw Phi-4 mini direct logits38.0%measured
35JEV Qwen3.5-9B Base NVFP437.7%measured
36Instinct Dual 4B36.9%estimated ± 10.7 pp, low confidence
37OpenJev DiffusionGemma 26B-A4B NVFP436.9%measured
38kev 4B36.1%measured
39Decision 2B v5935.8%measured
40Qwen3.5-9B Jev-like data-mix v235.2%measured
41GPT-6 Luna (low)35.1%measured
42SimpleJev Qwen3.8-27B34.6%measured
43NInfer Qwen3.8-Flash-Next mixed34.0%measured
44swanOne33.6%measured
45GPT-6 Luna (medium)33.3%measured
46open-alternative-jev Qwen3.5-4B33.2%measured
47jev-local Qwen3.5-9B32.5%measured
48Decision Fast v53a32.5%measured
49decider-2b30.7%measured
50jeff30.6%measured
51Laya30.3%measured
52Autoloops Gemma 4 31B IT30.0%measured
53Standard One 8B29.1%measured
54lev-350m28.5%measured
55openjev-sglang Qwen3.6-35B-A3B27.7%measured
56Von 395M27.5%measured
57NInfer Qwen3.8-27B NVFP4 (T=1.5)26.9%measured
58NInfer Qwen3.8-27B NVFP426.3%measured
59kev 8B25.6%measured
60JevOne25.5%measured
61typecastlm25.3%measured
62Nemotron Diffusion 8B (optimized vLLM)25.1%estimated ± 10.7 pp, low confidence
63SimpleJev Qwen3.6-35B-A3B24.9%measured
64kev 0.6B24.8%measured
65Raw Qwen3 8B direct logits23.7%measured
66system-one Qwen3-8B23.4%measured
67AutoJev-27B22.6%estimated ± 10.7 pp, low confidence
68AutoJev-27B (RTX PRO 6000)22.6%estimated ± 10.7 pp, low confidence
69Eikos-27B22.2%estimated ± 10.7 pp, low confidence
70OpenDecision ModernBERT-large21.6%measured
71Bev / Bonsai 27B21.2%estimated ± 10.7 pp, low confidence
72LitJev Qwen3.8-27B19.5%measured
73openJev Verdict 1.419.0%measured
74kev 0.5B18.9%measured
75Bespoke Nimble 9B18.7%measured
76GPT-5.6 Luna (low)18.5%measured
77openJev Verdict18.1%measured
78Raw Qwen3 1.7B direct logits18.1%measured
79reflex-27b17.8%measured
80Bosun v3.1 0.6B17.3%estimated ± 10.7 pp, low confidence
81Deem 0.8B v117.2%estimated ± 10.7 pp, low confidence
82JevAct16.9%measured
83Laya multilingual16.7%estimated ± 10.7 pp, low confidence
84Laya typed-decisions16.7%estimated ± 10.7 pp, low confidence
85Needle 3 (2-bit)16.7%estimated ± 10.7 pp, low confidence
86Needle 3 (options as tools)16.7%estimated ± 10.7 pp, low confidence
87djev (thinking)15.2%measured
88GLiNER2 large15.1%measured
89OpenJev (thinking, BF16)14.8%measured
90Qwen3.5-0.8B Decision Model14.5%measured
91Gemini 3.1 Flash-Lite14.3%measured
92open-jev-deberta-v3-large12.6%measured
93smalljev semantic-v912.3%measured
94GLiNER2.5 base11.8%measured
95Instinct Qwen3.8-27B11.4%measured
96Open-Jev 9B11.2%measured
97Open-Jev 2B10.0%measured
98GLiNER2.5 multi9.8%measured
99CLM-8B8.6%measured
100SimpleJev Qwen3.5-0.8B7.5%measured
101GLiNER2.5 small7.2%measured
102Raw Qwen3 0.6B direct logits7.1%measured
103verdict-small5.7%measured
104DeepSeek V4.1 Flash4.8%measured
105Mirror2.1%measured
106Mixedbread mxbai-rerank-base-v20.4%measured
107BAAI bge-reranker-v2-m30.2%measured
108Alibaba GTE Reranker ModernBERT-base0.2%measured
109Certo v10.0%measured
110Open Jev JSON Canvas0.0%measured
111Qwen3.8-27B (Chutes TEE)0.0%measured

All leaderboards

Agentic · terminal

Agentic · tools

Coding

Math

Knowledge & reasoning

Instruction following

Multilingual

Vision & documents

Long context

General