Hard reasoning models ranked by quality, price and speed
Quality vs price
13 models on the frontier — nothing else is both cheaper and better.
Lower price is better. Pareto frontier: Gemma 4 E4B, Sarvam 30B, Qwen3.5 4B, Sarvam 105B, Ling 3.0 Flash, MiMo-V2.5, GPT-6 Luna, Qwen3.8 Flash-Next, GLM-5.3 Flash, MiMo-V2.6-Pro, Muse Spark 1.3, Claude Sonnet 5.5, Claude Opus 5.5.
- Best-value frontier (nothing is both cheaper and better)
- Evidencestrong → weak
- Estimated from other categories
- Estimated (price or speed)
- Hover a dot for details · click a lab to highlight it
Ranking · 182 models
Price $/M tokens (blended 3:1) · Speed output tokens/s
| Select to compare | Source | Details | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5Frontier | Anthropic | 99.9±2.6 | $8.00 | 92 | 2/4 benchmarks measured | Verified | |||
| 2 | Anthropic | 95.7±3.7 | $20.0 | 66 | 3/4 benchmarks measured | Verified | ||||
| 3 | Claude Sonnet 5.5Frontier | Anthropic | 95.3±4.9 | $4.00 | est.~79 | 2/4 benchmarks measured | Verified | |||
| 4 | OpenAI | 93.5±3.7 | $20.0 | 52 | 3/4 benchmarks measured | Verified | ||||
| 5 | Anthropic | 91.7±3.7 | $10.0 | 54 | 3/4 benchmarks measured | Verified | ||||
| 6 | Muse Spark 1.3Frontier | Meta | 86.9±3.7 | $2.00 | 219 | 3/4 benchmarks measured | Verified | |||
| 7 | Xiaomi MiMo | 86.1±5.1 | $0.54 | 49 | 2/4 benchmarks measured | Verified | ||||
| 8 | OpenAI | 85.8±5.1 | $4.00 | 110 | 2/4 benchmarks measured | Verified | ||||
| 9 | Kimi K3Open | Moonshot AI (Kimi) | 83.4±3.7 | $6.00 | 37 | 3/4 benchmarks measured | Verified | |||
| 10 | StepFun | 83.2±4.0 | $1.43 | 85 | 3/4 benchmarks measured | Mixed | ||||
| 11 | Google DeepMind | 82.9±3.7 | $1.50 | 291 | 3/4 benchmarks measured | Verified | ||||
| 12 | SpaceXAI (xAI) | 82.2±3.7 | $3.00 | 60 | 3/4 benchmarks measured | Verified | ||||
| 13 | Alibaba Qwen | 82.1±3.7 | $3.00 | 39 | 3/4 benchmarks measured | Verified | ||||
| 14 | SpaceXAI (xAI) | 81.8±5.1 | $3.00 | 40 | 2/4 benchmarks measured | Verified | ||||
| 15 | GLM-5.3Open | Z.ai (Zhipu) | 81.0±3.7 | $2.15 | 57 | 3/4 benchmarks measured | Verified | |||
| 16 | OpenAI | 80.1±3.7 | $4.50 | 83 | 3/4 benchmarks measured | Verified | ||||
| 17 | OpenAI | 79.9±3.7 | $11.3 | 91 | 3/4 benchmarks measured | Verified | ||||
| 18 | Hy4 previewOpen | Tencent Hunyuan | 78.9±6.6 | $1.25 | est.~78 | 2/4 benchmarks measured | Lab-reported | |||
| 19 | Alibaba Qwen | 78.8±3.7 | $3.00 | 38 | 3/4 benchmarks measured | Verified | ||||
| 20 | OpenAI | 78.5±5.8 | $4.81 | 145 | 2/4 benchmarks measured | Verified | ||||
| 21 | Z.ai (Zhipu) | 77.9±3.7 | $0.24 | 46 | 3/4 benchmarks measured | Verified | ||||
| 22 | Anthropic | 76.5±3.7 | $4.00 | 79 | 3/4 benchmarks measured | Verified | ||||
| 23 | DeepSeek | 76.1±4.0 | $0.52 | 232 | 3/4 benchmarks measured | Mixed | ||||
| 24 | Alibaba Qwen | 76.0±3.7 | $0.23 | 54 | 3/4 benchmarks measured | Verified | ||||
| 25 | Google DeepMind | 75.8±3.7 | $4.50 | 120 | 3/4 benchmarks measured | Verified | ||||
| 26 | DeepSeek | 75.6±3.7 | $1.98 | 97 | 3/4 benchmarks measured | Verified | ||||
| 27 | Alibaba Qwen | 73.5±6.6 | $0.23 | est.~54 | 2/4 benchmarks measured | Lab-reported | ||||
| 28 | GPT-6 LunaFrontier | OpenAI | 72.4±5.1 | $0.20 | 132 | 2/4 benchmarks measured | Verified | |||
| 29 | SpaceXAI (xAI) | 72.0±5.8 | $1.25 | 55 | 2/4 benchmarks measured | Verified | ||||
| 30 | MiniMax-M3Open | MiniMax | 70.7±3.7 | $0.52 | 118 | 3/4 benchmarks measured | Verified | |||
| 31 | Qwen3.8 27BOpen | Alibaba Qwen | 69.8±3.7 | $1.13 | 43 | 3/4 benchmarks measured | Verified | |||
| 32 | Motif 3Open | Motif Technologies | 69.3±5.8 | self-host~$0.13–1.19 | est.~96 | 2/4 benchmarks measured | Verified | |||
| 33 | Inkling SmallOpen | Thinking Machines Lab | 68.6±5.8 | $0.52 | 206 | 2/4 benchmarks measured | Verified | |||
| 34 | Nex-N2-ProOpen | Nex AGI | 68.3±5.8 | self-host~$0.20–1.76 | est.~92 | 2/4 benchmarks measured | Verified | |||
| 35 | MBZUAI Institute of Foundation Models | 65.8±3.7 | self-host~$0.17–1.38 | est.~88 | 3/4 benchmarks measured | Verified | ||||
| 36 | Alibaba Qwen | 65.6±3.7 | $0.70 | 65 | 3/4 benchmarks measured | Verified | ||||
| 37 | Kimi K2.7 CodeOpen | Moonshot AI (Kimi) | 65.4±3.7 | $1.71 | 66 | 3/4 benchmarks measured | Verified | |||
| 38 | Upstage | 64.7±5.8 | $0.52 | 93 | 2/4 benchmarks measured | Verified | ||||
| 39 | InklingOpen | Thinking Machines Lab | 64.6±3.6 | $1.76 | 184 | 4/4 benchmarks measured | Mixed | |||
| 40 | Apodex | 64.3±3.7 | $0.97 | est.~100 | 3/4 benchmarks measured | Verified | ||||
| 41 | Hy3Open | Tencent Hunyuan | 64.1±3.7 | $0.25 | 86 | 3/4 benchmarks measured | Verified | |||
| 42 | A.X-K2Open | SK Telecom | 63.9±5.8 | self-host~$0.25–2.21 | est.~84 | 2/4 benchmarks measured | Verified | |||
| 43 | Solar Open2 250BOpen | Upstage | 63.4±5.8 | self-host~$0.12–1.11 | est.~94 | 2/4 benchmarks measured | Verified | |||
| 44 | Xiaomi MiMo | 61.2±5.8 | $0.18 | 40 | 2/4 benchmarks measured | Verified | ||||
| 45 | OpenAI | 60.2±3.7 | $1.69 | 217 | 3/4 benchmarks measured | Verified | ||||
| 46 | Xing4.0-29B-A4BOpen | China Telecom AI (TeleAI) | 59.8±10.0 | self-host~$0.067–0.60 | est.~110 | 1/4 benchmarks measured | Lab-reported | |||
| 47 | Gemma 4 31BOpen | Google DeepMind | 59.6±4.5 | $0.21 | 35 | 3/4 benchmarks measured | Mixed | |||
| 48 | Nemotron 3 UltraOpen | NVIDIA | 58.9±3.7 | $1.07 | 215 | 3/4 benchmarks measured | Verified | |||
| 49 | inclusionAI (Ant Group) | 58.7±5.8 | $0.11 | 346 | 2/4 benchmarks measured | Verified | ||||
| 50 | Alibaba Qwen | 57.7±3.7 | $1.35 | 86 | 3/4 benchmarks measured | Verified | ||||
| 51 | inclusionAI (Ant Group) | 56.5±3.7 | $0.11 | 147 | 3/4 benchmarks measured | Verified | ||||
| 52 | LongCat 2.0Open | Meituan LongCat | 56.2±3.7 | $0.52 | est.~79 | 3/4 benchmarks measured | Verified | |||
| 53 | MBZUAI Institute of Foundation Models | 56.1±3.7 | self-host~$0.053–0.44 | est.~110 | 3/4 benchmarks measured | Verified | ||||
| 54 | OpenAI | 55.9±3.7 | $0.46 | 165 | 3/4 benchmarks measured | Verified | ||||
| 55 | OpenAI | 55.4±5.8 | $3.50 | 143 | 2/4 benchmarks measured | Verified | ||||
| 56 | Step 3.7 FlashOpen | StepFun | 55.4±5.8 | $0.44 | 190 | 2/4 benchmarks measured | Verified | |||
| 57 | OpenAI | 54.3±3.7 | $11.3 | 123 | 3/4 benchmarks measured | Verified | ||||
| 58 | Muse GlimmerOpen | Meta | 54.0±3.6 | $0.58 | 133 | 4/4 benchmarks measured | Mixed | |||
| 59 | Shanghai AI Lab (Intern) | 53.6±8.6 | self-host~$0.046–0.38 | est.~120 | 1/4 benchmarks measured | Lab-reported | ||||
| 60 | Alibaba Qwen | 52.5±3.7 | $1.10 | 129 | 3/4 benchmarks measured | Verified | ||||
| 61 | LG AI Research (EXAONE) | 52.3±5.8 | self-host~$0.29–2.58 | est.~82 | 2/4 benchmarks measured | Verified | ||||
| 62 | Qwen3.6 35B A3BOpen | Alibaba Qwen | 52.0±3.7 | $0.84 | 120 | 3/4 benchmarks measured | Verified | |||
| 63 | Google DeepMind | 51.7±3.7 | $0.85 | 351 | 3/4 benchmarks measured | Verified | ||||
| 64 | Gemma 4 26B A4BOpen | Google DeepMind | 51.6±5.8 | $0.16 | est.~89 | 2/4 benchmarks measured | Verified | |||
| 65 | Kwaipilot (Kuaishou) | 51.6±5.8 | $0.52 | est.~110 | 2/4 benchmarks measured | Verified | ||||
| 66 | inclusionAI (Ant Group) | 51.3±5.1 | $0.11 | 159 | 2/4 benchmarks measured | Verified | ||||
| 67 | Ring-2.6-1TOpen | inclusionAI (Ant Group) | 51.1±3.7 | $0.85 | 119 | 3/4 benchmarks measured | Verified | |||
| 68 | Multiverse Computing | 50.2±3.7 | $0.90 | 152 | 3/4 benchmarks measured | Verified | ||||
| 69 | Amazon Nova | 50.1±4.3 | $0.85 | 167 | 3/4 benchmarks measured | Verified | ||||
| 70 | G9v3-39A5BOpen | AI9Stars | 50.1±5.8 | self-host~$0.061–0.50 | est.~110 | 2/4 benchmarks measured | Verified | |||
| 71 | Alibaba Qwen | 50.0±5.8 | $1.50 | 82 | 2/4 benchmarks measured | Verified | ||||
| 72 | Qwen3.5 9BOpen | Alibaba Qwen | 48.2±5.8 | $0.15 | 60 | 2/4 benchmarks measured | Verified | |||
| 73 | gpt-oss-120bOpen | OpenAI | 47.8±3.4 | $0.26 | 186 | 4/4 benchmarks measured | Verified | |||
| 74 | K2 Horizon 7BOpen | MBZUAI Institute of Foundation Models | 47.1±3.7 | self-host~$0.083–0.74 | est.~100 | 3/4 benchmarks measured | Verified | |||
| 75 | Microsoft AI | 46.9±7.5 | self-host~$0.12–1.08 | est.~48 | 2/4 benchmarks measured | Lab-reported | ||||
| 76 | Amazon Nova | 46.7±4.3 | $3.44 | 120 | 3/4 benchmarks measured | Verified | ||||
| 77 | NVIDIA | 45.6±3.7 | $0.45 | 164 | 3/4 benchmarks measured | Verified | ||||
| 78 | EXAONE 4.5 33BOpen | LG AI Research (EXAONE) | 45.5±5.8 | self-host~$0.17–1.49 | est.~84 | 2/4 benchmarks measured | Verified | |||
| 79 | Nanbeige4.1-3BOpen | Nanbeige | 45.2±5.8 | self-host~$0.047–0.42 | est.~110 | 2/4 benchmarks measured | Verified | |||
| 80 | Multiverse Computing | 44.5±5.8 | self-host~$0.066–0.59 | est.~110 | 2/4 benchmarks measured | Verified | ||||
| 81 | Mistral AI | 43.9±3.6 | $3.00 | 149 | 4/4 benchmarks measured | Mixed | ||||
| 82 | NVIDIA | 42.0±5.8 | self-host~$0.044–0.37 | est.~210 | 2/4 benchmarks measured | Verified | ||||
| 83 | Cogito v2.1Open | Deep Cogito | 41.7±5.8 | $1.25 | est.~82 | 2/4 benchmarks measured | Verified | |||
| 84 | INTELLECT-3Open | Prime Intellect | 41.6±5.8 | self-host~$0.12–0.97 | est.~97 | 2/4 benchmarks measured | Verified | |||
| 85 | Anthropic | 41.0±3.4 | $2.00 | 109 | 4/4 benchmarks measured | Verified | ||||
| 86 | Mistral Small 4Open | Mistral AI | 40.5±3.6 | $0.26 | 170 | 4/4 benchmarks measured | Mixed | |||
| 87 | ServiceNow | 39.7±5.8 | self-host~$0.12–1.09 | est.~94 | 2/4 benchmarks measured | Verified | ||||
| 88 | Sarvam AI | 39.0±5.8 | $0.07 | est.~99 | 2/4 benchmarks measured | Verified | ||||
| 89 | Arcee AI | 38.9±3.7 | $0.39 | 337 | 3/4 benchmarks measured | Verified | ||||
| 90 | Ling-2.6-1TOpen | inclusionAI (Ant Group) | 38.9±5.8 | $0.85 | est.~87 | 2/4 benchmarks measured | Verified | |||
| 91 | gpt-oss-20bOpen | OpenAI | 38.6±3.4 | $0.10 | 181 | 4/4 benchmarks measured | Verified | |||
| 92 | Command A+Open | Cohere | 38.4±3.7 | self-host~$0.19–1.56 | 214 | 3/4 benchmarks measured | Verified | |||
| 93 | K2 Horizon 3.7BOpen | MBZUAI Institute of Foundation Models | 38.3±3.7 | self-host~$0.056–0.50 | est.~110 | 3/4 benchmarks measured | Verified | |||
| 94 | Amazon Nova | 38.2±5.8 | $0.85 | est.~170 | 2/4 benchmarks measured | Verified | ||||
| 95 | Nous Research | 37.7±5.8 | $1.50 | 42 | 2/4 benchmarks measured | Verified | ||||
| 96 | Ling 3.0 TinyOpen | inclusionAI (Ant Group) | 36.7±5.8 | self-host~$0.029–0.24 | 31 | 2/4 benchmarks measured | Verified | |||
| 97 | K2 Think V2Open | MBZUAI Institute of Foundation Models | 36.4±5.8 | self-host~$0.36–3.22 | est.~74 | 2/4 benchmarks measured | Verified | |||
| 98 | Step3 VL 10BOpen | StepFun | 36.4±5.8 | self-host~$0.091–0.81 | est.~120 | 2/4 benchmarks measured | Verified | |||
| 99 | Mistral AI | 36.3±4.3 | $0.75 | est.~110 | 3/4 benchmarks measured | Verified | ||||
| 100 | NVIDIA | 36.2±3.7 | $0.11 | 267 | 3/4 benchmarks measured | Verified | ||||
| 101 | Alibaba Qwen | 35.6±5.8 | $0.41 | 158 | 2/4 benchmarks measured | Verified | ||||
| 102 | Google DeepMind | 35.5±5.8 | self-host~$0.062–0.56 | est.~89 | 2/4 benchmarks measured | Verified | ||||
| 103 | Alibaba Qwen | 35.5±5.8 | $0.06 | 23 | 2/4 benchmarks measured | Verified | ||||
| 104 | Ring-flash-2.0Open | inclusionAI (Ant Group) | 35.3±5.8 | $0.25 | est.~120 | 2/4 benchmarks measured | Verified | |||
| 105 | K2-V2Open | MBZUAI Institute of Foundation Models | 35.3±5.8 | self-host~$0.35–3.09 | est.~75 | 2/4 benchmarks measured | Verified | |||
| 106 | North Mini CodeOpen | Cohere | 35.2±3.7 | self-host~$0.044–0.37 | 93 | 3/4 benchmarks measured | Verified | |||
| 107 | Baidu ERNIE | 34.9±5.8 | $0.49 | est.~79 | 2/4 benchmarks measured | Verified | ||||
| 108 | NVIDIA | 34.6±3.7 | $0.09 | 245 | 3/4 benchmarks measured | Verified | ||||
| 109 | Falcon-H1R-7BOpen | TII (Falcon) | 34.5±5.8 | self-host~$0.074–0.66 | est.~100 | 2/4 benchmarks measured | Verified | |||
| 110 | Solar Open 100BOpen | Upstage | 34.1±5.8 | self-host~$0.12–0.95 | est.~97 | 2/4 benchmarks measured | Verified | |||
| 111 | NVIDIA | 33.7±5.8 | self-host~$0.88–8.40 | est.~110 | 2/4 benchmarks measured | Verified | ||||
| 112 | Qwen3 Coder NextOpen | Alibaba Qwen | 33.3±3.7 | $0.56 | 126 | 3/4 benchmarks measured | Verified | |||
| 113 | MiniCPM5-2BOpen | OpenBMB (MiniCPM) | 33.2±3.7 | self-host~$0.035–0.31 | est.~120 | 3/4 benchmarks measured | Verified | |||
| 114 | Granite 4.2 30BOpen | IBM Granite | 32.9±5.8 | $0.28 | 77 | 2/4 benchmarks measured | Verified | |||
| 115 | Inception | 31.3±5.1 | $0.34 | 781 | 2/4 benchmarks measured | Verified | ||||
| 116 | Gemma 4 12BOpen | Google DeepMind | 30.3±5.8 | $0.15 | 118 | 2/4 benchmarks measured | Verified | |||
| 117 | Granite 4.2 8BOpen | IBM Granite | 29.8±3.7 | $0.11 | 83 | 3/4 benchmarks measured | Verified | |||
| 118 | Sarvam AI | 28.7±5.8 | $0.05 | est.~120 | 2/4 benchmarks measured | Verified | ||||
| 119 | Meituan LongCat | 28.5±5.8 | self-host~$0.059–0.52 | est.~120 | 2/4 benchmarks measured | Verified | ||||
| 120 | NAVER HyperCLOVA X | 26.9±5.8 | self-host~$0.17–1.50 | est.~83 | 2/4 benchmarks measured | Verified | ||||
| 121 | Tri-21B-ThinkOpen | Trillion Labs | 26.7±5.8 | self-host~$0.16–1.46 | est.~90 | 2/4 benchmarks measured | Verified | |||
| 122 | Mistral Large 3Open | Mistral AI | 25.4±3.4 | $0.75 | 77 | 4/4 benchmarks measured | Verified | |||
| 123 | EXAONE 4.0 32BOpen | LG AI Research (EXAONE) | 25.4±5.8 | self-host~$0.16–1.46 | est.~84 | 2/4 benchmarks measured | Verified | |||
| 124 | Alibaba Qwen | 25.4±5.8 | $0.43 | 96 | 2/4 benchmarks measured | Verified | ||||
| 125 | Celeris | 24.5±3.7 | $0.33 | 1521 | 3/4 benchmarks measured | Verified | ||||
| 126 | Ai2 (Allen Institute) | 24.1±5.8 | self-host~$0.16–1.46 | est.~84 | 2/4 benchmarks measured | Verified | ||||
| 127 | NVIDIA | 23.4±5.8 | $0.30 | 201 | 2/4 benchmarks measured | Verified | ||||
| 128 | Granite 4.2 3BOpen | IBM Granite | 23.4±3.7 | $0.05 | 220 | 3/4 benchmarks measured | Verified | |||
| 129 | Llama 4 MaverickOpen | Meta | 22.9±4.3 | $0.42 | 114 | 3/4 benchmarks measured | Verified | |||
| 130 | LFM2.5-2.6BOpen | Liquid AI | 22.4±5.8 | self-host~$0.037–0.33 | est.~120 | 2/4 benchmarks measured | Verified | |||
| 131 | Devstral 2Open | Mistral AI | 22.1±3.4 | self-host~$0.53–5.07 | est.~84 | 4/4 benchmarks measured | Verified | |||
| 132 | Google DeepMind | 21.6±5.8 | $0.04 | 61 | 2/4 benchmarks measured | Verified | ||||
| 133 | GLM-4.6VOpen | Z.ai (Zhipu) | 21.4±5.8 | $0.45 | 68 | 2/4 benchmarks measured | Verified | |||
| 134 | LFM2.5-8B-A1BOpen | Liquid AI | 21.1±5.8 | self-host~$0.031–0.26 | est.~130 | 2/4 benchmarks measured | Verified | |||
| 135 | NVIDIA | 20.9±5.8 | $0.09 | 155 | 2/4 benchmarks measured | Verified | ||||
| 136 | Phi-4Open | Microsoft AI | 20.2±5.8 | $0.22 | 40 | 2/4 benchmarks measured | Verified | |||
| 137 | Ai2 (Allen Institute) | 20.2±5.8 | self-host~$0.16–1.46 | est.~84 | 2/4 benchmarks measured | Verified | ||||
| 138 | Olmo 3 7B ThinkOpen | Ai2 (Allen Institute) | 19.7±5.8 | self-host~$0.072–0.64 | est.~100 | 2/4 benchmarks measured | Verified | |||
| 139 | NVIDIA | 19.4±5.8 | self-host~$0.047–0.42 | est.~200 | 2/4 benchmarks measured | Verified | ||||
| 140 | Ministral 3 14BOpen | Mistral AI | 19.4±3.4 | $0.20 | 87 | 4/4 benchmarks measured | Verified | |||
| 141 | Devstral Small 2Open | Mistral AI | 19.3±3.4 | self-host~$0.19–1.67 | est.~110 | 4/4 benchmarks measured | Verified | |||
| 142 | Reka Flash 3Open | Reka AI | 18.6±5.8 | $0.35 | est.~89 | 2/4 benchmarks measured | Verified | |||
| 143 | Command AOpen | Cohere | 18.6±5.8 | $4.38 | 57 | 2/4 benchmarks measured | Verified | |||
| 144 | NVIDIA | 18.1±5.8 | $0.42 | 275 | 2/4 benchmarks measured | Verified | ||||
| 145 | Llama 4 ScoutOpen | Meta | 17.4±4.3 | $0.31 | 107 | 3/4 benchmarks measured | Verified | |||
| 146 | Microsoft AI | 17.0±8.3 | self-host~$0.046–0.41 | est.~58 | 2/4 benchmarks measured | Lab-reported | ||||
| 147 | TII (Falcon) | 16.7±7.5 | self-host~$0.17–1.52 | est.~83 | 2/4 benchmarks measured | Lab-reported | ||||
| 148 | Qwen3.5 2BOpen | Alibaba Qwen | 16.6±5.8 | self-host~$0.030–0.27 | est.~95 | 2/4 benchmarks measured | Verified | |||
| 149 | Ministral 3 8BOpen | Mistral AI | 16.5±3.4 | $0.15 | 87 | 4/4 benchmarks measured | Verified | |||
| 150 | Nous Research | 16.1±5.8 | self-host~$0.35–3.12 | est.~67 | 2/4 benchmarks measured | Verified | ||||
| 151 | LFM2 24B A2BOpen | Liquid AI | 16.1±5.8 | self-host~$0.051–0.42 | est.~120 | 2/4 benchmarks measured | Verified | |||
| 152 | Exaone 4.0 1.2BOpen | LG AI Research (EXAONE) | 14.8±5.8 | self-host~$0.024–0.20 | est.~140 | 2/4 benchmarks measured | Verified | |||
| 153 | Meta | 14.2±5.8 | self-host~$0.47–4.23 | est.~63 | 2/4 benchmarks measured | Verified | ||||
| 154 | Ai2 (Allen Institute) | 13.8±5.8 | $0.13 | est.~100 | 2/4 benchmarks measured | Verified | ||||
| 155 | Gemma 4 E2BOpen | Google DeepMind | 13.6±5.8 | self-host~$0.035–0.32 | est.~96 | 2/4 benchmarks measured | Verified | |||
| 156 | Molmo2-8BOpen | Ai2 (Allen Institute) | 13.4±5.8 | self-host~$0.081–0.72 | est.~100 | 2/4 benchmarks measured | Verified | |||
| 157 | IBM Granite | 12.6±5.8 | $0.11 | 48 | 2/4 benchmarks measured | Verified | ||||
| 158 | Meta | 12.5±4.3 | $0.71 | 85 | 3/4 benchmarks measured | Verified | ||||
| 159 | Liquid AI | 11.9±5.8 | self-host~$0.023–0.19 | est.~140 | 2/4 benchmarks measured | Verified | ||||
| 160 | Liquid AI | 11.8±5.8 | self-host~$0.023–0.19 | est.~140 | 2/4 benchmarks measured | Verified | ||||
| 161 | Ministral 3 3BOpen | Mistral AI | 11.8±3.4 | $0.10 | 231 | 4/4 benchmarks measured | Verified | |||
| 162 | MiniCPM5-1BOpen | OpenBMB (MiniCPM) | 11.7±5.8 | self-host~$0.021–0.18 | est.~140 | 2/4 benchmarks measured | Verified | |||
| 163 | Jamba 1.7 LargeOpen | AI21 Labs | 11.3±5.8 | self-host~$0.55–4.92 | est.~71 | 2/4 benchmarks measured | Verified | |||
| 164 | OpenBMB (MiniCPM) | 11.1±5.8 | self-host~$0.024–0.20 | est.~140 | 2/4 benchmarks measured | Verified | ||||
| 165 | Moonshot AI (Kimi) | 10.7±5.8 | self-host~$0.051–0.42 | est.~96 | 2/4 benchmarks measured | Verified | ||||
| 166 | Amazon Nova | 10.5±5.8 | $0.06 | 277 | 2/4 benchmarks measured | Verified | ||||
| 167 | IBM Granite | 10.0±5.8 | self-host~$0.043–0.38 | est.~110 | 2/4 benchmarks measured | Verified | ||||
| 168 | AI21 Labs | 9.5±5.8 | self-host~$0.041–0.37 | est.~120 | 2/4 benchmarks measured | Verified | ||||
| 169 | Jamba 1.7 MiniOpen | AI21 Labs | 9.1±5.8 | self-host~$0.10–0.90 | est.~97 | 2/4 benchmarks measured | Verified | |||
| 170 | Microsoft AI | 9.1±5.8 | self-host~$0.060–0.53 | 17 | 2/4 benchmarks measured | Verified | ||||
| 171 | Tiny Aya GlobalOpen | Cohere | 9.0±5.8 | self-host~$0.042–0.38 | est.~130 | 2/4 benchmarks measured | Verified | |||
| 172 | LFM2.5-VL-1.6BOpen | Liquid AI | 8.8±5.8 | self-host~$0.028–0.23 | est.~130 | 2/4 benchmarks measured | Verified | |||
| 173 | IBM Granite | 8.8±5.8 | self-host~$0.011–0.088 | est.~150 | 2/4 benchmarks measured | Verified | ||||
| 174 | Swiss AI Initiative (Apertus) | 8.5±5.8 | $1.34 | est.~75 | 2/4 benchmarks measured | Verified | ||||
| 175 | K2 Horizon 0.9BOpen | MBZUAI Institute of Foundation Models | 8.2±3.7 | self-host~$0.021–0.18 | est.~140 | 3/4 benchmarks measured | Verified | |||
| 176 | Qwen3.5 0.8BOpen | Alibaba Qwen | 8.0±5.8 | self-host~$0.018–0.15 | est.~110 | 2/4 benchmarks measured | Verified | |||
| 177 | Granite 4.0 350MOpen | IBM Granite | 7.9±5.8 | self-host~$0.011–0.090 | est.~150 | 2/4 benchmarks measured | Verified | |||
| 178 | Granite 4.0 H 1BOpen | IBM Granite | 7.9±5.8 | self-host~$0.026–0.21 | est.~120 | 2/4 benchmarks measured | Verified | |||
| 179 | Swiss AI Initiative (Apertus) | 7.4±5.8 | $0.13 | est.~100 | 2/4 benchmarks measured | Verified | ||||
| 180 | Meta | 7.2±5.8 | $0.34 | 15 | 2/4 benchmarks measured | Verified | ||||
| 181 | Molmo 7B-DOpen | Ai2 (Allen Institute) | 6.8±5.8 | self-host~$0.077–0.68 | est.~100 | 2/4 benchmarks measured | Verified | |||
| 182 | Gemma 3 270MOpen | Google DeepMind | 4.8±5.3 | self-host~$0.009–0.077 | est.~130 | 2/4 benchmarks measured | Verified |
About hard reasoning
Graduate-level science and competition math. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology
- GPQA Diamond(day 0)
- Humanity's Last Exam(day 0)
- AIME (latest)(day 0)
- AA Intelligence Index(third-party)
Day-0 (model cards) Third-party
- Fully verified
- 92%
- of 182 models