Writing & chat models ranked by quality, price and speed
Quality vs price
14 models on the frontier — nothing else is both cheaper and better.
Lower price is better. Pareto frontier: Gemma 4 E4B, Qwen3.5 4B, Gemma 4 12B, Qwen3.5 9B, Gemma 4 26B A4B, GPT-6 Luna, Qwen3.8 Flash-Next, MiMo-V2.6-Pro, Step 5 Preview, GLM-5.3, Kimi K3, Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1.
- Best-value frontier (nothing is both cheaper and better)
- Evidencestrong → weak
- Estimated from other categories
- Estimated (price or speed)
- Hover a dot for details · click a lab to highlight it
Ranking · 146 models
Price $/M tokens (blended 3:1) · Speed output tokens/s
| Select to compare | Source | Details | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1Frontier | Anthropic | 97.6±3.5 | $20.0 | 66 | 3/5 benchmarks measured | Verified | |||
| 2 | Claude Opus 5Frontier | Anthropic | 93.4±4.3 | $10.0 | 54 | 3/5 benchmarks measured | Verified | |||
| 3 | Claude Opus 5.5Frontier | Anthropic | 93.0±4.3 | $8.00 | 92 | 3/5 benchmarks measured | Verified | |||
| 4 | OpenAI | 92.1±5.3 | $20.0 | 52 | 3/5 benchmarks measured | Verified | ||||
| 5 | Moonshot AI (Kimi) | 89.1±4.3 | $6.00 | 37 | 3/5 benchmarks measured | Verified | ||||
| 6 | Z.ai (Zhipu) | 86.0±4.3 | $2.15 | 57 | 3/5 benchmarks measured | Verified | ||||
| 7 | OpenAI | 83.1±4.3 | $4.00 | 110 | 3/5 benchmarks measured | Verified | ||||
| 8 | StepFun | 82.6±12.7 | $1.43 | 85 | 0/5 benchmarks measured | Estimated | ||||
| 9 | Alibaba Qwen | 82.3±6.0 | $3.00 | 39 | 2/5 benchmarks measured | Verified | ||||
| 10 | Meta | 82.3±4.6 | $2.00 | 219 | 3/5 benchmarks measured | Verified | ||||
| 11 | Xiaomi MiMo | 81.8±6.0 | $0.54 | 49 | 2/5 benchmarks measured | Verified | ||||
| 12 | Alibaba Qwen | 80.0±9.7 | $0.23 | 54 | 1/5 benchmarks measured | Lab-reported | ||||
| 13 | Alibaba Qwen | 78.8±9.7 | $0.23 | est.~54 | 1/5 benchmarks measured | Lab-reported | ||||
| 14 | GLM-5.3 FlashOpen | Z.ai (Zhipu) | 78.4±6.0 | $0.24 | 46 | 2/5 benchmarks measured | Verified | |||
| 15 | Google DeepMind | 77.8±4.6 | $1.50 | 291 | 3/5 benchmarks measured | Verified | ||||
| 16 | OpenAI | 77.0±3.3 | $11.3 | 91 | 4/5 benchmarks measured | Verified | ||||
| 17 | OpenAI | 76.9±9.5 | $4.81 | 145 | 1/5 benchmarks measured | Verified | ||||
| 18 | Google DeepMind | 75.4±3.4 | $4.50 | 120 | 5/5 benchmarks measured | Mixed | ||||
| 19 | DeepSeek | 74.1±6.0 | $1.98 | 97 | 2/5 benchmarks measured | Verified | ||||
| 20 | Alibaba Qwen | 73.2±7.3 | $3.00 | 38 | 2/5 benchmarks measured | Mixed | ||||
| 21 | Alibaba Qwen | 72.9±4.2 | $0.70 | 65 | 3/5 benchmarks measured | Verified | ||||
| 22 | SpaceXAI (xAI) | 72.0±6.0 | $3.00 | 60 | 2/5 benchmarks measured | Verified | ||||
| 23 | OpenAI | 71.7±3.3 | $4.50 | 83 | 4/5 benchmarks measured | Verified | ||||
| 24 | MiniMax-M3Open | MiniMax | 71.0±4.2 | $0.52 | 118 | 3/5 benchmarks measured | Verified | |||
| 25 | SpaceXAI (xAI) | 71.0±4.3 | $3.00 | 40 | 3/5 benchmarks measured | Verified | ||||
| 26 | DeepSeek | 69.8±4.3 | $0.52 | 232 | 3/5 benchmarks measured | Verified | ||||
| 27 | OpenAI | 69.1±4.2 | $1.69 | 217 | 3/5 benchmarks measured | Verified | ||||
| 28 | Alibaba Qwen | 69.0±4.2 | $1.35 | 86 | 3/5 benchmarks measured | Verified | ||||
| 29 | Anthropic | 68.3±4.3 | $4.00 | 79 | 3/5 benchmarks measured | Verified | ||||
| 30 | Hy3Open | Tencent Hunyuan | 67.7±6.0 | $0.25 | 86 | 2/5 benchmarks measured | Verified | |||
| 31 | Shanghai AI Lab (Intern) | 67.7±9.7 | self-host~$0.046–0.38 | est.~120 | 1/5 benchmarks measured | Lab-reported | ||||
| 32 | Xing4.0-29B-A4BOpen | China Telecom AI (TeleAI) | 67.4±9.7 | self-host~$0.067–0.60 | est.~110 | 1/5 benchmarks measured | Lab-reported | |||
| 33 | GPT-6 LunaFrontier | OpenAI | 67.2±6.0 | $0.20 | 132 | 2/5 benchmarks measured | Verified | |||
| 34 | Amazon Nova | 65.5±9.5 | $3.44 | 120 | 1/5 benchmarks measured | Verified | ||||
| 35 | Google DeepMind | 64.8±4.5 | $0.16 | est.~89 | 3/5 benchmarks measured | Verified | ||||
| 36 | OpenAI | 64.4±9.5 | $3.50 | 143 | 1/5 benchmarks measured | Verified | ||||
| 37 | Qwen3.8 27BOpen | Alibaba Qwen | 64.3±3.6 | $1.13 | 43 | 4/5 benchmarks measured | Mixed | |||
| 38 | InklingOpen | Thinking Machines Lab | 63.8±3.6 | $1.76 | 184 | 4/5 benchmarks measured | Mixed | |||
| 39 | Gemma 4 31BOpen | Google DeepMind | 63.5±3.6 | $0.21 | 35 | 5/5 benchmarks measured | Mixed | |||
| 40 | MiMo-V2.5Open | Xiaomi MiMo | 61.6±4.2 | $0.18 | 40 | 3/5 benchmarks measured | Verified | |||
| 41 | Step 3.7 FlashOpen | StepFun | 61.6±9.5 | $0.44 | 190 | 1/5 benchmarks measured | Verified | |||
| 42 | Muse GlimmerOpen | Meta | 61.4±4.4 | $0.58 | 133 | 4/5 benchmarks measured | Mixed | |||
| 43 | Amazon Nova | 61.2±9.5 | $0.85 | 167 | 1/5 benchmarks measured | Verified | ||||
| 44 | Google DeepMind | 61.0±4.3 | $0.85 | 351 | 3/5 benchmarks measured | Verified | ||||
| 45 | Nex-N2-ProOpen | Nex AGI | 60.7±9.5 | self-host~$0.20–1.76 | est.~92 | 1/5 benchmarks measured | Verified | |||
| 46 | Nemotron 3 UltraOpen | NVIDIA | 60.7±3.3 | $1.07 | 215 | 4/5 benchmarks measured | Verified | |||
| 47 | NVIDIA | 59.3±9.5 | self-host~$0.044–0.37 | est.~210 | 1/5 benchmarks measured | Verified | ||||
| 48 | Alibaba Qwen | 58.7±4.2 | $1.10 | 129 | 3/5 benchmarks measured | Verified | ||||
| 49 | Mistral AI | 58.3±4.2 | $3.00 | 149 | 3/5 benchmarks measured | Verified | ||||
| 50 | Alibaba Qwen | 56.4±9.5 | $0.15 | 60 | 1/5 benchmarks measured | Verified | ||||
| 51 | Kimi K2.7 CodeOpen | Moonshot AI (Kimi) | 56.4±9.5 | $1.71 | 66 | 1/5 benchmarks measured | Verified | |||
| 52 | OpenAI | 55.6±4.2 | $0.46 | 165 | 3/5 benchmarks measured | Verified | ||||
| 53 | Amazon Nova | 53.8±9.5 | $0.85 | est.~170 | 1/5 benchmarks measured | Verified | ||||
| 54 | Kwaipilot (Kuaishou) | 53.2±9.5 | $0.52 | est.~110 | 1/5 benchmarks measured | Verified | ||||
| 55 | ServiceNow | 52.9±9.5 | self-host~$0.12–1.09 | est.~94 | 1/5 benchmarks measured | Verified | ||||
| 56 | Qwen3.6 35B A3BOpen | Alibaba Qwen | 52.0±9.5 | $0.84 | 120 | 1/5 benchmarks measured | Verified | |||
| 57 | Command A+Open | Cohere | 51.0±9.5 | self-host~$0.19–1.56 | 214 | 1/5 benchmarks measured | Verified | |||
| 58 | NVIDIA | 51.0±9.5 | $0.45 | 164 | 1/5 benchmarks measured | Verified | ||||
| 59 | EXAONE 4.5 33BOpen | LG AI Research (EXAONE) | 50.5±9.5 | self-host~$0.17–1.49 | est.~84 | 1/5 benchmarks measured | Verified | |||
| 60 | Multiverse Computing | 50.4±9.5 | self-host~$0.066–0.59 | est.~110 | 1/5 benchmarks measured | Verified | ||||
| 61 | Alibaba Qwen | 50.3±9.5 | $1.50 | 82 | 1/5 benchmarks measured | Verified | ||||
| 62 | Anthropic | 49.7±3.8 | $2.00 | 109 | 4/5 benchmarks measured | Mixed | ||||
| 63 | Google DeepMind | 47.2±9.5 | self-host~$0.062–0.56 | est.~89 | 1/5 benchmarks measured | Verified | ||||
| 64 | K2 Think V2Open | MBZUAI Institute of Foundation Models | 45.3±9.5 | self-host~$0.36–3.22 | est.~74 | 1/5 benchmarks measured | Verified | |||
| 65 | Ling-2.6-1TOpen | inclusionAI (Ant Group) | 45.1±9.5 | $0.85 | est.~87 | 1/5 benchmarks measured | Verified | |||
| 66 | NVIDIA | 44.1±9.5 | $0.42 | 275 | 1/5 benchmarks measured | Verified | ||||
| 67 | K2-V2Open | MBZUAI Institute of Foundation Models | 44.0±9.5 | self-host~$0.35–3.09 | est.~75 | 1/5 benchmarks measured | Verified | |||
| 68 | Solar Open 100BOpen | Upstage | 42.9±9.5 | self-host~$0.12–0.95 | est.~97 | 1/5 benchmarks measured | Verified | |||
| 69 | Alibaba Qwen | 42.0±4.2 | $0.41 | 158 | 3/5 benchmarks measured | Verified | ||||
| 70 | Step3 VL 10BOpen | StepFun | 40.8±9.5 | self-host~$0.091–0.81 | est.~120 | 1/5 benchmarks measured | Verified | |||
| 71 | Mistral Large 3Open | Mistral AI | 40.8±3.3 | $0.75 | 77 | 4/5 benchmarks measured | Verified | |||
| 72 | Tri-21B-ThinkOpen | Trillion Labs | 40.2±9.5 | self-host~$0.16–1.46 | est.~90 | 1/5 benchmarks measured | Verified | |||
| 73 | Falcon-H1R-7BOpen | TII (Falcon) | 39.9±9.5 | self-host~$0.074–0.66 | est.~100 | 1/5 benchmarks measured | Verified | |||
| 74 | North Mini CodeOpen | Cohere | 39.5±9.5 | self-host~$0.044–0.37 | 93 | 1/5 benchmarks measured | Verified | |||
| 75 | Arcee AI | 39.4±4.2 | $0.39 | 337 | 3/5 benchmarks measured | Verified | ||||
| 76 | NVIDIA | 39.2±9.5 | self-host~$0.047–0.42 | est.~200 | 1/5 benchmarks measured | Verified | ||||
| 77 | gpt-oss-120bOpen | OpenAI | 38.1±3.4 | $0.26 | 186 | 5/5 benchmarks measured | Mixed | |||
| 78 | Ring-2.6-1TOpen | inclusionAI (Ant Group) | 38.1±9.5 | $0.85 | 119 | 1/5 benchmarks measured | Verified | |||
| 79 | LFM2.5-8B-A1BOpen | Liquid AI | 37.4±9.5 | self-host~$0.031–0.26 | est.~130 | 1/5 benchmarks measured | Verified | |||
| 80 | Mistral Small 4Open | Mistral AI | 37.2±9.5 | $0.26 | 170 | 1/5 benchmarks measured | Verified | |||
| 81 | Mistral AI | 36.9±9.5 | $0.75 | est.~110 | 1/5 benchmarks measured | Verified | ||||
| 82 | Google DeepMind | 36.6±9.5 | $0.15 | 118 | 1/5 benchmarks measured | Verified | ||||
| 83 | Cogito v2.1Open | Deep Cogito | 35.4±9.5 | $1.25 | est.~82 | 1/5 benchmarks measured | Verified | |||
| 84 | Meituan LongCat | 32.6±9.5 | self-host~$0.059–0.52 | est.~120 | 1/5 benchmarks measured | Verified | ||||
| 85 | MiniCPM5-1BOpen | OpenBMB (MiniCPM) | 32.6±9.5 | self-host~$0.021–0.18 | est.~140 | 1/5 benchmarks measured | Verified | |||
| 86 | AI21 Labs | 32.4±9.5 | self-host~$0.041–0.37 | est.~120 | 1/5 benchmarks measured | Verified | ||||
| 87 | Alibaba Qwen | 32.1±9.5 | $0.06 | 23 | 1/5 benchmarks measured | Verified | ||||
| 88 | NVIDIA | 31.9±4.2 | $0.09 | 245 | 3/5 benchmarks measured | Verified | ||||
| 89 | gpt-oss-20bOpen | OpenAI | 31.4±4.2 | $0.10 | 181 | 3/5 benchmarks measured | Verified | |||
| 90 | Google DeepMind | 30.2±9.5 | $0.04 | 61 | 1/5 benchmarks measured | Verified | ||||
| 91 | GLM-4.6VOpen | Z.ai (Zhipu) | 29.8±5.1 | $0.45 | 68 | 3/5 benchmarks measured | Verified | |||
| 92 | LFM2 24B A2BOpen | Liquid AI | 29.5±9.5 | self-host~$0.051–0.42 | est.~120 | 1/5 benchmarks measured | Verified | |||
| 93 | Nanbeige4.1-3BOpen | Nanbeige | 29.1±9.5 | self-host~$0.047–0.42 | est.~110 | 1/5 benchmarks measured | Verified | |||
| 94 | NAVER HyperCLOVA X | 29.0±9.5 | self-host~$0.17–1.50 | est.~83 | 1/5 benchmarks measured | Verified | ||||
| 95 | Meta | 28.5±9.5 | $0.71 | 85 | 1/5 benchmarks measured | Verified | ||||
| 96 | Baidu ERNIE | 28.1±9.5 | $0.49 | est.~79 | 1/5 benchmarks measured | Verified | ||||
| 97 | Sarvam 105BOpen | Sarvam AI | 28.0±9.5 | $0.07 | est.~99 | 1/5 benchmarks measured | Verified | |||
| 98 | INTELLECT-3Open | Prime Intellect | 27.6±4.5 | self-host~$0.12–0.97 | est.~97 | 3/5 benchmarks measured | Verified | |||
| 99 | Llama 4 ScoutOpen | Meta | 27.5±9.5 | $0.31 | 107 | 1/5 benchmarks measured | Verified | |||
| 100 | Qwen3 Coder NextOpen | Alibaba Qwen | 27.0±9.5 | $0.56 | 126 | 1/5 benchmarks measured | Verified | |||
| 101 | Olmo 3 7B ThinkOpen | Ai2 (Allen Institute) | 26.9±9.5 | self-host~$0.072–0.64 | est.~100 | 1/5 benchmarks measured | Verified | |||
| 102 | Liquid AI | 26.8±9.5 | self-host~$0.023–0.19 | est.~140 | 1/5 benchmarks measured | Verified | ||||
| 103 | NVIDIA | 25.9±5.1 | self-host~$0.88–8.40 | est.~110 | 3/5 benchmarks measured | Verified | ||||
| 104 | Liquid AI | 25.8±9.5 | self-host~$0.023–0.19 | est.~140 | 1/5 benchmarks measured | Verified | ||||
| 105 | Nous Research | 25.6±9.5 | $1.50 | 42 | 1/5 benchmarks measured | Verified | ||||
| 106 | Devstral 2Open | Mistral AI | 25.6±9.5 | self-host~$0.53–5.07 | est.~84 | 1/5 benchmarks measured | Verified | |||
| 107 | Alibaba Qwen | 25.5±9.5 | $0.43 | 96 | 1/5 benchmarks measured | Verified | ||||
| 108 | NVIDIA | 25.3±9.5 | $0.30 | 201 | 1/5 benchmarks measured | Verified | ||||
| 109 | Llama 4 MaverickOpen | Meta | 24.7±3.3 | $0.42 | 114 | 4/5 benchmarks measured | Verified | |||
| 110 | Ring-flash-2.0Open | inclusionAI (Ant Group) | 23.9±4.5 | $0.25 | est.~120 | 3/5 benchmarks measured | Verified | |||
| 111 | Command AOpen | Cohere | 23.6±9.5 | $4.38 | 57 | 1/5 benchmarks measured | Verified | |||
| 112 | Ai2 (Allen Institute) | 23.4±4.2 | self-host~$0.16–1.46 | est.~84 | 3/5 benchmarks measured | Verified | ||||
| 113 | Ai2 (Allen Institute) | 23.3±4.2 | self-host~$0.16–1.46 | est.~84 | 3/5 benchmarks measured | Verified | ||||
| 114 | Gemma 4 E2BOpen | Google DeepMind | 22.8±9.5 | self-host~$0.035–0.32 | est.~96 | 1/5 benchmarks measured | Verified | |||
| 115 | Qwen3.5 2BOpen | Alibaba Qwen | 22.8±9.5 | self-host~$0.030–0.27 | est.~95 | 1/5 benchmarks measured | Verified | |||
| 116 | EXAONE 4.0 32BOpen | LG AI Research (EXAONE) | 22.6±9.5 | self-host~$0.16–1.46 | est.~84 | 1/5 benchmarks measured | Verified | |||
| 117 | Ministral 3 14BOpen | Mistral AI | 22.3±9.5 | $0.20 | 87 | 1/5 benchmarks measured | Verified | |||
| 118 | Devstral Small 2Open | Mistral AI | 21.8±9.5 | self-host~$0.19–1.67 | est.~110 | 1/5 benchmarks measured | Verified | |||
| 119 | Jamba 1.7 LargeOpen | AI21 Labs | 21.0±9.5 | self-host~$0.55–4.92 | est.~71 | 1/5 benchmarks measured | Verified | |||
| 120 | Sarvam 30BOpen | Sarvam AI | 20.2±9.5 | $0.05 | est.~120 | 1/5 benchmarks measured | Verified | |||
| 121 | Ai2 (Allen Institute) | 20.0±9.5 | $0.13 | est.~100 | 1/5 benchmarks measured | Verified | ||||
| 122 | Ministral 3 8BOpen | Mistral AI | 19.8±9.5 | $0.15 | 87 | 1/5 benchmarks measured | Verified | |||
| 123 | OpenBMB (MiniCPM) | 19.5±9.5 | self-host~$0.024–0.20 | est.~140 | 1/5 benchmarks measured | Verified | ||||
| 124 | Reka Flash 3Open | Reka AI | 19.3±9.5 | $0.35 | est.~89 | 1/5 benchmarks measured | Verified | |||
| 125 | LFM2.5-VL-1.6BOpen | Liquid AI | 19.2±9.5 | self-host~$0.028–0.23 | est.~130 | 1/5 benchmarks measured | Verified | |||
| 126 | IBM Granite | 19.1±9.5 | $0.11 | 48 | 1/5 benchmarks measured | Verified | ||||
| 127 | Nous Research | 18.6±9.5 | self-host~$0.35–3.12 | est.~67 | 1/5 benchmarks measured | Verified | ||||
| 128 | NVIDIA | 18.5±9.5 | $0.09 | 155 | 1/5 benchmarks measured | Verified | ||||
| 129 | Molmo2-8BOpen | Ai2 (Allen Institute) | 18.5±5.1 | self-host~$0.081–0.72 | est.~100 | 3/5 benchmarks measured | Verified | |||
| 130 | Jamba 1.7 MiniOpen | AI21 Labs | 17.9±9.5 | self-host~$0.10–0.90 | est.~97 | 1/5 benchmarks measured | Verified | |||
| 131 | Meta | 17.7±9.5 | $0.34 | 15 | 1/5 benchmarks measured | Verified | ||||
| 132 | Amazon Nova | 17.3±9.5 | $0.06 | 277 | 1/5 benchmarks measured | Verified | ||||
| 133 | Ministral 3 3BOpen | Mistral AI | 16.9±9.5 | $0.10 | 231 | 1/5 benchmarks measured | Verified | |||
| 134 | Moonshot AI (Kimi) | 16.1±9.5 | self-host~$0.051–0.42 | est.~96 | 1/5 benchmarks measured | Verified | ||||
| 135 | Exaone 4.0 1.2BOpen | LG AI Research (EXAONE) | 16.1±9.5 | self-host~$0.024–0.20 | est.~140 | 1/5 benchmarks measured | Verified | |||
| 136 | Granite 4.0 H 1BOpen | IBM Granite | 14.5±9.5 | self-host~$0.026–0.21 | est.~120 | 1/5 benchmarks measured | Verified | |||
| 137 | Swiss AI Initiative (Apertus) | 14.3±9.5 | $1.34 | est.~75 | 1/5 benchmarks measured | Verified | ||||
| 138 | IBM Granite | 14.3±9.5 | self-host~$0.043–0.38 | est.~110 | 1/5 benchmarks measured | Verified | ||||
| 139 | Qwen3.5 0.8BOpen | Alibaba Qwen | 13.9±9.5 | self-host~$0.018–0.15 | est.~110 | 1/5 benchmarks measured | Verified | |||
| 140 | Swiss AI Initiative (Apertus) | 11.9±9.5 | $0.13 | est.~100 | 1/5 benchmarks measured | Verified | ||||
| 141 | Molmo 7B-DOpen | Ai2 (Allen Institute) | 10.9±9.5 | self-host~$0.077–0.68 | est.~100 | 1/5 benchmarks measured | Verified | |||
| 142 | Tiny Aya GlobalOpen | Cohere | 10.7±9.5 | self-host~$0.042–0.38 | est.~130 | 1/5 benchmarks measured | Verified | |||
| 143 | IBM Granite | 9.5±9.5 | self-host~$0.011–0.088 | est.~150 | 1/5 benchmarks measured | Verified | ||||
| 144 | Granite 4.0 350MOpen | IBM Granite | 8.3±8.9 | self-host~$0.011–0.090 | est.~150 | 1/5 benchmarks measured | Verified | |||
| 145 | Phi-4Open | Microsoft AI | 5.8±4.2 | $0.22 | 40 | 3/5 benchmarks measured | Verified | |||
| 146 | Gemma 3 270MOpen | Google DeepMind | 5.0±7.3 | self-host~$0.009–0.077 | est.~130 | 1/5 benchmarks measured | Verified |
About writing & chat
Instruction following, creative writing, and translation. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology
- IFBench(day 0)
- MMMLU(day 0)
- LMArena Text, Non-English (Elo)(third-party)
- LMArena Text (Elo)(third-party)
- EQ-Bench Creative Writing v3 (Elo)(third-party)
Day-0 (model cards) Third-party
- Fully verified
- 92%
- of 146 models