Agents models ranked by quality, price and speed
Quality vs price
10 models on the frontier — nothing else is both cheaper and better.
Lower price is better. Pareto frontier: Gemma 4 E4B, Sarvam 30B, Qwen3.5 4B, Sarvam 105B, Ling 3.0 Flash, MiMo-V2.6-Flash, Qwen3.8 Flash-Next, GLM-5.3 Flash, Muse Spark 1.3, Claude Opus 5.5.
- Best-value frontier (nothing is both cheaper and better)
- Evidencestrong → weak
- Estimated from other categories
- Estimated (price or speed)
- Hover a dot for details · click a lab to highlight it
Ranking · 173 models
Price $/M tokens (blended 3:1) · Speed output tokens/s
| Select to compare | Source | Details | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5Frontier | Anthropic | 99.6±4.1 | $8.00 | 92 | 2/7 benchmarks measured | Verified | |||
| 2 | Anthropic | 89.6±5.8 | $20.0 | 66 | 3/7 benchmarks measured | Verified | ||||
| 3 | Muse Spark 1.3Frontier | Meta | 87.4±5.8 | $2.00 | 219 | 3/7 benchmarks measured | Verified | |||
| 4 | GLM-5.3Open | Z.ai (Zhipu) | 87.4±5.8 | $2.15 | 57 | 3/7 benchmarks measured | Verified | |||
| 5 | SpaceXAI (xAI) | 86.7±7.8 | $3.00 | 40 | 2/7 benchmarks measured | Verified | ||||
| 6 | Z.ai (Zhipu) | 85.5±5.1 | $0.24 | 46 | 4/7 benchmarks measured | Mixed | ||||
| 7 | Alibaba Qwen | 85.2±5.8 | $3.00 | 39 | 3/7 benchmarks measured | Verified | ||||
| 8 | Anthropic | 84.8±4.6 | $10.0 | 54 | 4/7 benchmarks measured | Mixed | ||||
| 9 | MiMo-V2.6-ProOpen | Xiaomi MiMo | 84.4±6.4 | $0.54 | 49 | 3/7 benchmarks measured | Mixed | |||
| 10 | SpaceXAI (xAI) | 84.1±5.8 | $3.00 | 60 | 3/7 benchmarks measured | Verified | ||||
| 11 | Alibaba Qwen | 83.0±5.8 | $3.00 | 38 | 3/7 benchmarks measured | Verified | ||||
| 12 | Kimi K3Open | Moonshot AI (Kimi) | 82.4±3.5 | $6.00 | 37 | 6/7 benchmarks measured | Mixed | |||
| 13 | DeepSeek | 82.1±7.8 | $0.52 | 232 | 2/7 benchmarks measured | Verified | ||||
| 14 | Alibaba Qwen | 81.7±5.8 | $0.23 | 54 | 3/7 benchmarks measured | Verified | ||||
| 15 | OpenAI | 81.6±4.6 | $20.0 | 52 | 4/7 benchmarks measured | Mixed | ||||
| 16 | Google DeepMind | 76.1±5.8 | $1.50 | 291 | 3/7 benchmarks measured | Verified | ||||
| 17 | OpenAI | 76.0±7.8 | $4.00 | 110 | 2/7 benchmarks measured | Verified | ||||
| 18 | StepFun | 75.4±6.3 | $1.43 | 85 | 3/7 benchmarks measured | Mixed | ||||
| 19 | Xiaomi MiMo | 74.8±10.7 | $0.18 | 55 | 1/7 benchmarks measured | Lab-reported | ||||
| 20 | Qwen3.8 27BOpen | Alibaba Qwen | 74.2±4.7 | $1.13 | 43 | 4/7 benchmarks measured | Mixed | |||
| 21 | Nex-N2.5-ProOpen | Nex AGI | 73.9±8.9 | self-host~$0.20–1.76 | est.~92 | 2/7 benchmarks measured | Lab-reported | |||
| 22 | OpenAI | 72.3±3.2 | $4.50 | 83 | 6/7 benchmarks measured | Mixed | ||||
| 23 | DeepSeek | 71.5±5.8 | $1.98 | 97 | 3/7 benchmarks measured | Verified | ||||
| 24 | Shanghai AI Lab (Intern) | 71.0±10.5 | self-host~$0.30–2.69 | est.~81 | 1/7 benchmarks measured | Lab-reported | ||||
| 25 | OpenAI | 69.3±10.0 | $4.81 | 145 | 1/7 benchmarks measured | Verified | ||||
| 26 | OpenAI | 67.4±3.2 | $11.3 | 91 | 7/7 benchmarks measured | Mixed | ||||
| 27 | Anthropic | 65.3±3.8 | $4.00 | 79 | 5/7 benchmarks measured | Mixed | ||||
| 28 | Motif 3Open | Motif Technologies | 65.2±10.0 | self-host~$0.13–1.19 | est.~96 | 1/7 benchmarks measured | Verified | |||
| 29 | OpenAI | 64.2±7.8 | $0.20 | 132 | 2/7 benchmarks measured | Verified | ||||
| 30 | MBZUAI Institute of Foundation Models | 56.3±5.8 | self-host~$0.17–1.38 | est.~88 | 3/7 benchmarks measured | Verified | ||||
| 31 | OpenAI | 54.9±10.0 | $3.50 | 143 | 1/7 benchmarks measured | Verified | ||||
| 32 | Google DeepMind | 54.7±3.4 | $4.50 | 120 | 5/7 benchmarks measured | Mixed | ||||
| 33 | Alibaba Qwen | 53.5±10.0 | $1.50 | 82 | 1/7 benchmarks measured | Verified | ||||
| 34 | inclusionAI (Ant Group) | 49.8±10.0 | $0.11 | 346 | 1/7 benchmarks measured | Verified | ||||
| 35 | Nex-N2.5-MiniOpen | Nex AGI | 49.1±8.9 | self-host~$0.046–0.38 | est.~120 | 2/7 benchmarks measured | Lab-reported | |||
| 36 | Upstage | 47.9±10.0 | $0.52 | 93 | 1/7 benchmarks measured | Verified | ||||
| 37 | Solar Open2 250BOpen | Upstage | 47.5±10.0 | self-host~$0.12–1.11 | est.~94 | 1/7 benchmarks measured | Verified | |||
| 38 | MiniMax-M3Open | MiniMax | 47.4±3.4 | $0.52 | 118 | 5/7 benchmarks measured | Mixed | |||
| 39 | Amazon Nova | 47.2±7.8 | $3.44 | 120 | 2/7 benchmarks measured | Verified | ||||
| 40 | MBZUAI Institute of Foundation Models | 47.2±5.8 | self-host~$0.053–0.44 | est.~110 | 3/7 benchmarks measured | Verified | ||||
| 41 | OpenAI | 47.2±4.2 | $1.69 | 217 | 4/7 benchmarks measured | Verified | ||||
| 42 | Ling-2.6-1TOpen | inclusionAI (Ant Group) | 47.0±10.0 | $0.85 | est.~87 | 1/7 benchmarks measured | Verified | |||
| 43 | Apodex | 46.6±5.8 | $0.97 | est.~100 | 3/7 benchmarks measured | Verified | ||||
| 44 | Amazon Nova | 46.5±10.0 | $0.85 | est.~170 | 1/7 benchmarks measured | Verified | ||||
| 45 | Inkling SmallOpen | Thinking Machines Lab | 46.3±10.0 | $0.52 | 206 | 1/7 benchmarks measured | Verified | |||
| 46 | inclusionAI (Ant Group) | 45.4±5.8 | $0.11 | 147 | 3/7 benchmarks measured | Verified | ||||
| 47 | Kimi K2.7 CodeOpen | Moonshot AI (Kimi) | 45.3±4.2 | $1.71 | 66 | 4/7 benchmarks measured | Verified | |||
| 48 | Hy3Open | Tencent Hunyuan | 45.1±4.6 | $0.25 | 86 | 4/7 benchmarks measured | Mixed | |||
| 49 | Multiverse Computing | 43.9±5.8 | $0.90 | 152 | 3/7 benchmarks measured | Verified | ||||
| 50 | G9v3-39A5BOpen | AI9Stars | 43.0±10.0 | self-host~$0.061–0.50 | est.~110 | 1/7 benchmarks measured | Verified | |||
| 51 | Amazon Nova | 42.6±7.8 | $0.85 | 167 | 2/7 benchmarks measured | Verified | ||||
| 52 | InklingOpen | Thinking Machines Lab | 42.5±4.6 | $1.76 | 184 | 4/7 benchmarks measured | Mixed | |||
| 53 | Alibaba Qwen | 42.3±4.2 | $0.70 | 65 | 4/7 benchmarks measured | Verified | ||||
| 54 | ServiceNow | 41.7±10.0 | self-host~$0.12–1.09 | est.~94 | 1/7 benchmarks measured | Verified | ||||
| 55 | NAVER HyperCLOVA X | 41.3±10.0 | self-host~$0.17–1.50 | est.~83 | 1/7 benchmarks measured | Verified | ||||
| 56 | A.X-K2Open | SK Telecom | 41.1±10.0 | self-host~$0.25–2.21 | est.~84 | 1/7 benchmarks measured | Verified | |||
| 57 | EXAONE 4.5 33BOpen | LG AI Research (EXAONE) | 41.1±7.8 | self-host~$0.17–1.49 | est.~84 | 2/7 benchmarks measured | Verified | |||
| 58 | Step 3.7 FlashOpen | StepFun | 41.0±5.8 | $0.44 | 190 | 3/7 benchmarks measured | Verified | |||
| 59 | Google DeepMind | 40.6±4.7 | $0.85 | 351 | 4/7 benchmarks measured | Mixed | ||||
| 60 | K2 Horizon 7BOpen | MBZUAI Institute of Foundation Models | 40.5±5.8 | self-host~$0.083–0.74 | est.~100 | 3/7 benchmarks measured | Verified | |||
| 61 | Nex-N2-ProOpen | Nex AGI | 40.3±4.2 | self-host~$0.20–1.76 | est.~92 | 4/7 benchmarks measured | Verified | |||
| 62 | Tri-21B-ThinkOpen | Trillion Labs | 39.9±10.0 | self-host~$0.16–1.46 | est.~90 | 1/7 benchmarks measured | Verified | |||
| 63 | OpenAI | 39.5±4.2 | $0.46 | 165 | 4/7 benchmarks measured | Verified | ||||
| 64 | OpenBMB (MiniCPM) | 39.5±10.0 | self-host~$0.024–0.20 | est.~140 | 1/7 benchmarks measured | Verified | ||||
| 65 | OpenAI | 39.3±5.8 | $11.3 | 123 | 3/7 benchmarks measured | Verified | ||||
| 66 | Meituan LongCat | 39.2±10.0 | self-host~$0.059–0.52 | est.~120 | 1/7 benchmarks measured | Verified | ||||
| 67 | SpaceXAI (xAI) | 38.5±7.8 | $1.25 | 55 | 2/7 benchmarks measured | Verified | ||||
| 68 | MiniCPM5-1BOpen | OpenBMB (MiniCPM) | 38.0±10.0 | self-host~$0.021–0.18 | est.~140 | 1/7 benchmarks measured | Verified | |||
| 69 | MiMo-V2.5Open | Xiaomi MiMo | 37.9±4.2 | $0.18 | 40 | 4/7 benchmarks measured | Verified | |||
| 70 | Qwen3.5 2BOpen | Alibaba Qwen | 37.7±10.0 | self-host~$0.030–0.27 | est.~95 | 1/7 benchmarks measured | Verified | |||
| 71 | Alibaba Qwen | 37.2±4.2 | $1.35 | 86 | 4/7 benchmarks measured | Verified | ||||
| 72 | Alibaba Qwen | 36.9±4.2 | $1.10 | 129 | 4/7 benchmarks measured | Verified | ||||
| 73 | Ring-2.6-1TOpen | inclusionAI (Ant Group) | 36.0±4.2 | $0.85 | 119 | 4/7 benchmarks measured | Verified | |||
| 74 | Ling 3.0 TinyOpen | inclusionAI (Ant Group) | 35.9±10.0 | self-host~$0.029–0.24 | 31 | 1/7 benchmarks measured | Verified | |||
| 75 | Muse GlimmerOpen | Meta | 35.8±4.7 | $0.58 | 133 | 4/7 benchmarks measured | Mixed | |||
| 76 | Mistral AI | 35.0±3.4 | $3.00 | 149 | 5/7 benchmarks measured | Mixed | ||||
| 77 | Qwen3.6 35B A3BOpen | Alibaba Qwen | 34.3±4.2 | $0.84 | 120 | 4/7 benchmarks measured | Verified | |||
| 78 | Qwen3.5 9BOpen | Alibaba Qwen | 34.0±5.8 | $0.15 | 60 | 3/7 benchmarks measured | Verified | |||
| 79 | NVIDIA | 33.6±7.8 | self-host~$0.044–0.37 | est.~210 | 2/7 benchmarks measured | Verified | ||||
| 80 | Kwaipilot (Kuaishou) | 32.8±5.8 | $0.52 | est.~110 | 3/7 benchmarks measured | Verified | ||||
| 81 | LG AI Research (EXAONE) | 32.3±10.0 | self-host~$0.29–2.58 | est.~82 | 1/7 benchmarks measured | Verified | ||||
| 82 | K2 Horizon 3.7BOpen | MBZUAI Institute of Foundation Models | 32.2±5.8 | self-host~$0.056–0.50 | est.~110 | 3/7 benchmarks measured | Verified | |||
| 83 | Solar Open 100BOpen | Upstage | 31.8±10.0 | self-host~$0.12–0.95 | est.~97 | 1/7 benchmarks measured | Verified | |||
| 84 | Qwen3.5 0.8BOpen | Alibaba Qwen | 31.8±10.0 | self-host~$0.018–0.15 | est.~110 | 1/7 benchmarks measured | Verified | |||
| 85 | Sarvam AI | 31.4±10.0 | $0.07 | est.~99 | 1/7 benchmarks measured | Verified | ||||
| 86 | Nemotron 3 UltraOpen | NVIDIA | 31.3±3.4 | $1.07 | 215 | 5/7 benchmarks measured | Mixed | |||
| 87 | Alibaba Qwen | 30.8±7.8 | $0.06 | 23 | 2/7 benchmarks measured | Verified | ||||
| 88 | Gemma 4 31BOpen | Google DeepMind | 30.4±4.2 | $0.21 | 35 | 4/7 benchmarks measured | Verified | |||
| 89 | Arcee AI | 29.5±4.2 | $0.39 | 337 | 4/7 benchmarks measured | Verified | ||||
| 90 | Gemma 4 26B A4BOpen | Google DeepMind | 28.6±5.8 | $0.16 | est.~89 | 3/7 benchmarks measured | Verified | |||
| 91 | gpt-oss-120bOpen | OpenAI | 28.3±4.2 | $0.26 | 186 | 4/7 benchmarks measured | Verified | |||
| 92 | NVIDIA | 28.2±4.2 | $0.45 | 164 | 4/7 benchmarks measured | Verified | ||||
| 93 | Command A+Open | Cohere | 28.0±4.2 | self-host~$0.19–1.56 | 214 | 4/7 benchmarks measured | Verified | |||
| 94 | LongCat 2.0Open | Meituan LongCat | 28.0±5.8 | $0.52 | est.~79 | 3/7 benchmarks measured | Verified | |||
| 95 | NVIDIA | 28.0±7.8 | $0.42 | 275 | 2/7 benchmarks measured | Verified | ||||
| 96 | MiniCPM5-2BOpen | OpenBMB (MiniCPM) | 27.3±5.8 | self-host~$0.035–0.31 | est.~120 | 3/7 benchmarks measured | Verified | |||
| 97 | Multiverse Computing | 27.0±5.8 | self-host~$0.066–0.59 | est.~110 | 3/7 benchmarks measured | Verified | ||||
| 98 | Qwen3 Coder NextOpen | Alibaba Qwen | 26.9±4.2 | $0.56 | 126 | 4/7 benchmarks measured | Verified | |||
| 99 | Gemma 4 12BOpen | Google DeepMind | 26.7±10.0 | $0.15 | 118 | 1/7 benchmarks measured | Verified | |||
| 100 | Nanbeige4.1-3BOpen | Nanbeige | 26.4±10.0 | self-host~$0.047–0.42 | est.~110 | 1/7 benchmarks measured | Verified | |||
| 101 | K2-V2Open | MBZUAI Institute of Foundation Models | 26.1±10.0 | self-host~$0.35–3.09 | est.~75 | 1/7 benchmarks measured | Verified | |||
| 102 | Step3 VL 10BOpen | StepFun | 25.9±10.0 | self-host~$0.091–0.81 | est.~120 | 1/7 benchmarks measured | Verified | |||
| 103 | INTELLECT-3Open | Prime Intellect | 25.6±10.0 | self-host~$0.12–0.97 | est.~97 | 1/7 benchmarks measured | Verified | |||
| 104 | Falcon-H1R-7BOpen | TII (Falcon) | 25.4±10.0 | self-host~$0.074–0.66 | est.~100 | 1/7 benchmarks measured | Verified | |||
| 105 | Granite 4.2 30BOpen | IBM Granite | 25.4±5.8 | $0.28 | 77 | 3/7 benchmarks measured | Verified | |||
| 106 | K2 Think V2Open | MBZUAI Institute of Foundation Models | 25.1±7.8 | self-host~$0.36–3.22 | est.~74 | 2/7 benchmarks measured | Verified | |||
| 107 | Alibaba Qwen | 24.5±10.0 | $0.41 | 158 | 1/7 benchmarks measured | Verified | ||||
| 108 | gpt-oss-20bOpen | OpenAI | 24.0±4.2 | $0.10 | 181 | 4/7 benchmarks measured | Verified | |||
| 109 | Sarvam AI | 23.8±10.0 | $0.05 | est.~120 | 1/7 benchmarks measured | Verified | ||||
| 110 | Nous Research | 23.7±10.0 | $1.50 | 42 | 1/7 benchmarks measured | Verified | ||||
| 111 | GLM-4.6VOpen | Z.ai (Zhipu) | 22.4±10.0 | $0.45 | 68 | 1/7 benchmarks measured | Verified | |||
| 112 | Anthropic | 22.3±3.5 | $2.00 | 109 | 5/7 benchmarks measured | Mixed | ||||
| 113 | Inception | 21.8±7.8 | $0.34 | 781 | 2/7 benchmarks measured | Verified | ||||
| 114 | Google DeepMind | 21.7±10.0 | $0.04 | 61 | 1/7 benchmarks measured | Verified | ||||
| 115 | NVIDIA | 21.4±10.0 | self-host~$0.047–0.42 | est.~200 | 1/7 benchmarks measured | Verified | ||||
| 116 | NVIDIA | 21.0±5.8 | $0.11 | 267 | 3/7 benchmarks measured | Verified | ||||
| 117 | NVIDIA | 20.8±10.0 | $0.30 | 201 | 1/7 benchmarks measured | Verified | ||||
| 118 | Alibaba Qwen | 20.1±10.0 | $0.43 | 96 | 1/7 benchmarks measured | Verified | ||||
| 119 | Meta | 20.0±10.0 | $0.71 | 85 | 1/7 benchmarks measured | Verified | ||||
| 120 | Granite 4.2 8BOpen | IBM Granite | 19.8±5.8 | $0.11 | 83 | 3/7 benchmarks measured | Verified | |||
| 121 | NVIDIA | 19.5±10.0 | self-host~$0.88–8.40 | est.~110 | 1/7 benchmarks measured | Verified | ||||
| 122 | NVIDIA | 19.3±10.0 | $0.09 | 155 | 1/7 benchmarks measured | Verified | ||||
| 123 | Gemma 4 E2BOpen | Google DeepMind | 19.3±10.0 | self-host~$0.035–0.32 | est.~96 | 1/7 benchmarks measured | Verified | |||
| 124 | NVIDIA | 19.1±5.8 | $0.09 | 245 | 3/7 benchmarks measured | Verified | ||||
| 125 | North Mini CodeOpen | Cohere | 19.1±4.2 | self-host~$0.044–0.37 | 93 | 4/7 benchmarks measured | Verified | |||
| 126 | Devstral 2Open | Mistral AI | 18.9±4.2 | self-host~$0.53–5.07 | est.~84 | 4/7 benchmarks measured | Verified | |||
| 127 | LFM2.5-8B-A1BOpen | Liquid AI | 18.9±10.0 | self-host~$0.031–0.26 | est.~130 | 1/7 benchmarks measured | Verified | |||
| 128 | Ai2 (Allen Institute) | 18.8±10.0 | self-host~$0.16–1.46 | est.~84 | 1/7 benchmarks measured | Verified | ||||
| 129 | LFM2.5-2.6BOpen | Liquid AI | 18.8±10.0 | self-host~$0.037–0.33 | est.~120 | 1/7 benchmarks measured | Verified | |||
| 130 | Devstral Small 2Open | Mistral AI | 18.6±4.2 | self-host~$0.19–1.67 | est.~110 | 4/7 benchmarks measured | Verified | |||
| 131 | Nous Research | 18.5±10.0 | self-host~$0.35–3.12 | est.~67 | 1/7 benchmarks measured | Verified | ||||
| 132 | Liquid AI | 18.3±10.0 | self-host~$0.023–0.19 | est.~140 | 1/7 benchmarks measured | Verified | ||||
| 133 | Exaone 4.0 1.2BOpen | LG AI Research (EXAONE) | 18.3±10.0 | self-host~$0.024–0.20 | est.~140 | 1/7 benchmarks measured | Verified | |||
| 134 | Granite 4.0 H 1BOpen | IBM Granite | 18.0±10.0 | self-host~$0.026–0.21 | est.~120 | 1/7 benchmarks measured | Verified | |||
| 135 | AI21 Labs | 17.9±10.0 | self-host~$0.041–0.37 | est.~120 | 1/7 benchmarks measured | Verified | ||||
| 136 | Baidu ERNIE | 17.8±10.0 | $0.49 | est.~79 | 1/7 benchmarks measured | Verified | ||||
| 137 | IBM Granite | 17.6±10.0 | $0.11 | 48 | 1/7 benchmarks measured | Verified | ||||
| 138 | Command AOpen | Cohere | 17.3±10.0 | $4.38 | 57 | 1/7 benchmarks measured | Verified | |||
| 139 | Ring-flash-2.0Open | inclusionAI (Ant Group) | 17.1±10.0 | $0.25 | est.~120 | 1/7 benchmarks measured | Verified | |||
| 140 | Granite 4.2 3BOpen | IBM Granite | 17.0±5.8 | $0.05 | 220 | 3/7 benchmarks measured | Verified | |||
| 141 | Meta | 17.0±10.0 | $0.34 | 15 | 1/7 benchmarks measured | Verified | ||||
| 142 | IBM Granite | 16.9±10.0 | self-host~$0.011–0.088 | est.~150 | 1/7 benchmarks measured | Verified | ||||
| 143 | Jamba 1.7 LargeOpen | AI21 Labs | 16.7±10.0 | self-host~$0.55–4.92 | est.~71 | 1/7 benchmarks measured | Verified | |||
| 144 | Amazon Nova | 16.7±10.0 | $0.06 | 277 | 1/7 benchmarks measured | Verified | ||||
| 145 | Ministral 3 14BOpen | Mistral AI | 16.6±4.2 | $0.20 | 87 | 4/7 benchmarks measured | Verified | |||
| 146 | Granite 4.0 350MOpen | IBM Granite | 16.5±10.0 | self-host~$0.011–0.090 | est.~150 | 1/7 benchmarks measured | Verified | |||
| 147 | Ai2 (Allen Institute) | 16.5±10.0 | $0.13 | est.~100 | 1/7 benchmarks measured | Verified | ||||
| 148 | Swiss AI Initiative (Apertus) | 16.5±10.0 | $1.34 | est.~75 | 1/7 benchmarks measured | Verified | ||||
| 149 | Jamba 1.7 MiniOpen | AI21 Labs | 16.4±10.0 | self-host~$0.10–0.90 | est.~97 | 1/7 benchmarks measured | Verified | |||
| 150 | LFM2 24B A2BOpen | Liquid AI | 16.4±10.0 | self-host~$0.051–0.42 | est.~120 | 1/7 benchmarks measured | Verified | |||
| 151 | Mistral Large 3Open | Mistral AI | 16.4±4.2 | $0.75 | 77 | 4/7 benchmarks measured | Verified | |||
| 152 | IBM Granite | 16.4±10.0 | self-host~$0.043–0.38 | est.~110 | 1/7 benchmarks measured | Verified | ||||
| 153 | Liquid AI | 16.3±10.0 | self-host~$0.023–0.19 | est.~140 | 1/7 benchmarks measured | Verified | ||||
| 154 | Celeris | 16.1±5.8 | $0.33 | 1521 | 3/7 benchmarks measured | Verified | ||||
| 155 | Swiss AI Initiative (Apertus) | 16.1±10.0 | $0.13 | est.~100 | 1/7 benchmarks measured | Verified | ||||
| 156 | EXAONE 4.0 32BOpen | LG AI Research (EXAONE) | 15.9±10.0 | self-host~$0.16–1.46 | est.~84 | 1/7 benchmarks measured | Verified | |||
| 157 | Mistral AI | 15.9±5.8 | $0.75 | est.~110 | 3/7 benchmarks measured | Verified | ||||
| 158 | Gemma 3 270MOpen | Google DeepMind | 15.6±10.0 | self-host~$0.009–0.077 | est.~130 | 1/7 benchmarks measured | Verified | |||
| 159 | LFM2.5-VL-1.6BOpen | Liquid AI | 15.5±10.0 | self-host~$0.028–0.23 | est.~130 | 1/7 benchmarks measured | Verified | |||
| 160 | K2 Horizon 0.9BOpen | MBZUAI Institute of Foundation Models | 15.2±7.8 | self-host~$0.021–0.18 | est.~140 | 2/7 benchmarks measured | Verified | |||
| 161 | Ministral 3 3BOpen | Mistral AI | 15.1±4.2 | $0.10 | 231 | 4/7 benchmarks measured | Verified | |||
| 162 | Ministral 3 8BOpen | Mistral AI | 14.9±4.2 | $0.15 | 87 | 4/7 benchmarks measured | Verified | |||
| 163 | Ai2 (Allen Institute) | 14.7±10.0 | self-host~$0.16–1.46 | est.~84 | 1/7 benchmarks measured | Verified | ||||
| 164 | Mistral Small 4Open | Mistral AI | 14.6±3.4 | $0.26 | 170 | 5/7 benchmarks measured | Mixed | |||
| 165 | Olmo 3 7B ThinkOpen | Ai2 (Allen Institute) | 14.3±10.0 | self-host~$0.072–0.64 | est.~100 | 1/7 benchmarks measured | Verified | |||
| 166 | Phi-4Open | Microsoft AI | 13.9±10.0 | $0.22 | 40 | 1/7 benchmarks measured | Verified | |||
| 167 | Molmo2-8BOpen | Ai2 (Allen Institute) | 13.9±10.0 | self-host~$0.081–0.72 | est.~100 | 1/7 benchmarks measured | Verified | |||
| 168 | Reka Flash 3Open | Reka AI | 13.7±10.0 | $0.35 | est.~89 | 1/7 benchmarks measured | Verified | |||
| 169 | Molmo 7B-DOpen | Ai2 (Allen Institute) | 13.5±10.0 | self-host~$0.077–0.68 | est.~100 | 1/7 benchmarks measured | Verified | |||
| 170 | Moonshot AI (Kimi) | 13.5±10.0 | self-host~$0.051–0.42 | est.~96 | 1/7 benchmarks measured | Verified | ||||
| 170 | Tiny Aya GlobalOpen | Cohere | 13.5±10.0 | self-host~$0.042–0.38 | est.~130 | 1/7 benchmarks measured | Verified | |||
| 172 | Llama 4 MaverickOpen | Meta | 13.3±5.8 | $0.42 | 114 | 3/7 benchmarks measured | Verified | |||
| 173 | Llama 4 ScoutOpen | Meta | 12.1±5.8 | $0.31 | 107 | 3/7 benchmarks measured | Verified |
About agents
Tool use, computer use, and web research. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology
- τ²-bench (Telecom)(day 0)
- OSWorld-Verified(day 0)
- OSWorld 2.0(day 0)
- BrowseComp(day 0)
- GDPval-AA (Elo)(third-party)
- AutomationBench-AA(third-party)
- τ-Bench Banking (AA)(third-party)
Not comparable across labs (4)
Kept for reference, not counted in rankings: these use a lab-specific task set, answer key or scoring, so scores can't be compared fairly across labs. Only published scores are shown.
Day-0 (model cards) Third-party
- Fully verified
- 86%
- of 173 models