Coding models ranked by quality, price and speed
Quality vs price
10 models on the frontier — nothing else is both cheaper and better.
Lower price is better. Pareto frontier: Granite 4.2 3B, NVIDIA Nemotron 3 Nano 30B A3B, gpt-oss-20b, Ling-3.0-flash-VL, MiMo-V2.6-Flash, GLM-5.3 Flash, DeepSeek V4.1 Flash, MiMo-V2.6-Pro, Claude Sonnet 5.5, Claude Opus 5.5.
- Best-value frontier (nothing is both cheaper and better)
- Evidencestrong → weak
- Estimated from other categories
- Estimated (price or speed)
- Hover a dot for details · click a lab to highlight it
Ranking · 103 models
Price $/M tokens (blended 3:1) · Speed output tokens/s
| Select to compare | Source | Details | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5Frontier | Anthropic | 96.9±3.4 | $8.00 | 92 | 5/7 benchmarks measured | Mixed | |||
| 2 | Claude Sonnet 5.5Frontier | Anthropic | 91.7±5.2 | $4.00 | est.~79 | 4/7 benchmarks measured | Mixed | |||
| 3 | Anthropic | 87.5±3.6 | $20.0 | 66 | 5/7 benchmarks measured | Mixed | ||||
| 4 | OpenAI | 86.2±4.5 | $20.0 | 52 | 4/7 benchmarks measured | Verified | ||||
| 5 | Anthropic | 83.3±3.2 | $10.0 | 54 | 6/7 benchmarks measured | Mixed | ||||
| 6 | OpenAI | 78.7±4.5 | $4.00 | 110 | 4/7 benchmarks measured | Verified | ||||
| 7 | Xiaomi MiMo | 77.8±6.4 | $0.54 | 49 | 3/7 benchmarks measured | Mixed | ||||
| 8 | Meta | 74.9±4.5 | $2.00 | 219 | 4/7 benchmarks measured | Verified | ||||
| 9 | GLM-5.3Open | Z.ai (Zhipu) | 74.0±4.5 | $2.15 | 57 | 4/7 benchmarks measured | Verified | |||
| 10 | StepFun | 73.7±6.4 | $1.43 | 85 | 3/7 benchmarks measured | Mixed | ||||
| 11 | SpaceXAI (xAI) | 72.7±4.5 | $3.00 | 40 | 4/7 benchmarks measured | Verified | ||||
| 12 | OpenAI | 69.8±5.2 | $4.50 | 83 | 4/7 benchmarks measured | Mixed | ||||
| 13 | Hy4 previewOpen | Tencent Hunyuan | 67.4±8.6 | $1.25 | est.~78 | 2/7 benchmarks measured | Lab-reported | |||
| 14 | DeepSeek | 66.4±6.4 | $0.52 | 232 | 3/7 benchmarks measured | Mixed | ||||
| 15 | Z.ai (Zhipu) | 65.9±6.4 | $0.24 | 46 | 3/7 benchmarks measured | Mixed | ||||
| 16 | Kimi K3Open | Moonshot AI (Kimi) | 65.2±4.5 | $6.00 | 37 | 4/7 benchmarks measured | Verified | |||
| 17 | Xiaomi MiMo | 63.7±6.4 | $0.18 | 55 | 3/7 benchmarks measured | Mixed | ||||
| 18 | Alibaba Qwen | 63.1±8.6 | $0.23 | est.~54 | 2/7 benchmarks measured | Lab-reported | ||||
| 19 | Xing4.0-29B-A4BOpen | China Telecom AI (TeleAI) | 62.1±10.5 | self-host~$0.067–0.60 | est.~110 | 1/7 benchmarks measured | Lab-reported | |||
| 20 | Alibaba Qwen | 62.0±5.2 | $0.23 | 54 | 4/7 benchmarks measured | Mixed | ||||
| 21 | Nex-N2.5-ProOpen | Nex AGI | 61.6±8.6 | self-host~$0.20–1.76 | est.~92 | 2/7 benchmarks measured | Lab-reported | |||
| 22 | OpenAI | 60.2±5.2 | $11.3 | 91 | 4/7 benchmarks measured | Mixed | ||||
| 23 | Shanghai AI Lab (Intern) | 60.1±10.4 | self-host~$0.30–2.69 | est.~81 | 1/7 benchmarks measured | Lab-reported | ||||
| 24 | Alibaba Qwen | 59.1±4.5 | $3.00 | 39 | 4/7 benchmarks measured | Verified | ||||
| 25 | SpaceXAI (xAI) | 59.0±4.5 | $3.00 | 60 | 4/7 benchmarks measured | Verified | ||||
| 26 | Google DeepMind | 58.3±4.5 | $1.50 | 291 | 4/7 benchmarks measured | Verified | ||||
| 27 | Anthropic | 56.6±5.4 | $4.00 | 79 | 4/7 benchmarks measured | Mixed | ||||
| 28 | Alibaba Qwen | 55.6±6.4 | $3.00 | 38 | 3/7 benchmarks measured | Mixed | ||||
| 29 | Intern-S2-397BOpen | Shanghai AI Lab (Intern) | 54.0±8.5 | self-host~$0.20–1.76 | est.~92 | 2/7 benchmarks measured | Lab-reported | |||
| 30 | OpenAI | 52.5±4.5 | $0.20 | 132 | 4/7 benchmarks measured | Verified | ||||
| 31 | Google DeepMind | 51.7±5.4 | $4.50 | 120 | 4/7 benchmarks measured | Mixed | ||||
| 32 | DeepSeek | 51.4±4.5 | $1.98 | 97 | 4/7 benchmarks measured | Verified | ||||
| 33 | OpenAI | 50.1±8.0 | $11.3 | 123 | 2/7 benchmarks measured | Verified | ||||
| 34 | Solar Open2 250BOpen | Upstage | 47.3±10.0 | self-host~$0.12–1.11 | est.~94 | 1/7 benchmarks measured | Verified | |||
| 35 | Microsoft AI | 45.7±10.4 | self-host~$0.12–1.08 | est.~48 | 1/7 benchmarks measured | Lab-reported | ||||
| 36 | OpenAI | 45.2±8.0 | $1.69 | 217 | 2/7 benchmarks measured | Verified | ||||
| 37 | MiniMax-M3Open | MiniMax | 44.1±5.4 | $0.52 | 118 | 4/7 benchmarks measured | Mixed | |||
| 38 | Inkling SmallOpen | Thinking Machines Lab | 44.0±8.0 | $0.52 | 206 | 2/7 benchmarks measured | Verified | |||
| 39 | Qwen3.8 27BOpen | Alibaba Qwen | 43.9±5.2 | $1.13 | 43 | 4/7 benchmarks measured | Mixed | |||
| 40 | Motif 3Open | Motif Technologies | 41.2±10.0 | self-host~$0.13–1.19 | est.~96 | 1/7 benchmarks measured | Verified | |||
| 41 | Nex-N2-ProOpen | Nex AGI | 40.5±10.0 | self-host~$0.20–1.76 | est.~92 | 1/7 benchmarks measured | Verified | |||
| 42 | Step 3.7 FlashOpen | StepFun | 40.3±10.0 | $0.44 | 190 | 1/7 benchmarks measured | Verified | |||
| 43 | Kimi K2.7 CodeOpen | Moonshot AI (Kimi) | 40.2±8.0 | $1.71 | 66 | 2/7 benchmarks measured | Verified | |||
| 44 | Gemma 4 31BOpen | Google DeepMind | 39.6±6.5 | $0.21 | 35 | 3/7 benchmarks measured | Mixed | |||
| 45 | Alibaba Qwen | 39.5±8.0 | $0.70 | 65 | 2/7 benchmarks measured | Verified | ||||
| 46 | InklingOpen | Thinking Machines Lab | 39.3±5.4 | $1.76 | 184 | 4/7 benchmarks measured | Mixed | |||
| 47 | Multiverse Computing | 39.1±8.0 | $0.90 | 152 | 2/7 benchmarks measured | Verified | ||||
| 48 | OpenAI | 38.3±8.0 | $0.46 | 165 | 2/7 benchmarks measured | Verified | ||||
| 49 | Upstage | 37.5±8.0 | $0.52 | 93 | 2/7 benchmarks measured | Verified | ||||
| 50 | Apodex | 37.4±8.0 | $0.97 | est.~100 | 2/7 benchmarks measured | Verified | ||||
| 51 | Nemotron 3 UltraOpen | NVIDIA | 37.1±5.4 | $1.07 | 215 | 4/7 benchmarks measured | Mixed | |||
| 52 | Nex-N2.5-MiniOpen | Nex AGI | 36.7±8.6 | self-host~$0.046–0.38 | est.~120 | 2/7 benchmarks measured | Lab-reported | |||
| 53 | Alibaba Qwen | 36.6±8.0 | $1.35 | 86 | 2/7 benchmarks measured | Verified | ||||
| 54 | A.X-K2Open | SK Telecom | 36.3±10.0 | self-host~$0.25–2.21 | est.~84 | 1/7 benchmarks measured | Verified | |||
| 55 | MBZUAI Institute of Foundation Models | 36.3±8.0 | self-host~$0.17–1.38 | est.~88 | 2/7 benchmarks measured | Verified | ||||
| 56 | MiMo-V2.5Open | Xiaomi MiMo | 36.2±8.0 | $0.18 | 40 | 2/7 benchmarks measured | Verified | |||
| 57 | LG AI Research (EXAONE) | 36.0±10.0 | self-host~$0.29–2.58 | est.~82 | 1/7 benchmarks measured | Verified | ||||
| 58 | Muse GlimmerOpen | Meta | 35.9±5.4 | $0.58 | 133 | 4/7 benchmarks measured | Mixed | |||
| 59 | Ring-2.6-1TOpen | inclusionAI (Ant Group) | 35.7±8.0 | $0.85 | 119 | 2/7 benchmarks measured | Verified | |||
| 60 | inclusionAI (Ant Group) | 35.6±8.0 | $0.11 | 147 | 2/7 benchmarks measured | Verified | ||||
| 61 | Hy3Open | Tencent Hunyuan | 34.4±4.3 | $0.25 | 86 | 5/7 benchmarks measured | Mixed | |||
| 62 | Gemma 4 26B A4BOpen | Google DeepMind | 34.4±10.0 | $0.16 | est.~89 | 1/7 benchmarks measured | Verified | |||
| 63 | Ling 3.0 FlashOpen | inclusionAI (Ant Group) | 34.3±8.0 | $0.11 | 346 | 2/7 benchmarks measured | Verified | |||
| 64 | Mistral AI | 34.1±6.6 | $3.00 | 149 | 3/7 benchmarks measured | Mixed | ||||
| 65 | Google DeepMind | 34.0±6.5 | $0.85 | 351 | 3/7 benchmarks measured | Mixed | ||||
| 66 | OpenAI | 33.6±6.4 | $0.10 | 181 | 3/7 benchmarks measured | Verified | ||||
| 67 | inclusionAI (Ant Group) | 33.4±8.0 | $0.11 | 159 | 2/7 benchmarks measured | Verified | ||||
| 68 | Anthropic | 33.1±5.2 | $2.00 | 109 | 4/7 benchmarks measured | Mixed | ||||
| 69 | MBZUAI Institute of Foundation Models | 31.9±8.0 | self-host~$0.053–0.44 | est.~110 | 2/7 benchmarks measured | Verified | ||||
| 70 | Alibaba Qwen | 31.8±8.0 | $1.10 | 129 | 2/7 benchmarks measured | Verified | ||||
| 71 | Arcee AI | 31.1±8.0 | $0.39 | 337 | 2/7 benchmarks measured | Verified | ||||
| 72 | Mistral Small 4Open | Mistral AI | 30.8±6.5 | $0.26 | 170 | 3/7 benchmarks measured | Mixed | |||
| 73 | Shanghai AI Lab (Intern) | 30.2±8.6 | self-host~$0.046–0.38 | est.~120 | 2/7 benchmarks measured | Lab-reported | ||||
| 74 | gpt-oss-120bOpen | OpenAI | 30.2±5.2 | $0.26 | 186 | 4/7 benchmarks measured | Mixed | |||
| 75 | Command A+Open | Cohere | 29.6±8.0 | self-host~$0.19–1.56 | 214 | 2/7 benchmarks measured | Verified | |||
| 76 | North Mini CodeOpen | Cohere | 29.1±8.0 | self-host~$0.044–0.37 | 93 | 2/7 benchmarks measured | Verified | |||
| 77 | Qwen3.6 35B A3BOpen | Alibaba Qwen | 29.0±8.0 | $0.84 | 120 | 2/7 benchmarks measured | Verified | |||
| 78 | G9v3-39A5BOpen | AI9Stars | 28.7±10.0 | self-host~$0.061–0.50 | est.~110 | 1/7 benchmarks measured | Verified | |||
| 79 | Inception | 28.1±8.0 | $0.34 | 781 | 2/7 benchmarks measured | Verified | ||||
| 80 | LongCat 2.0Open | Meituan LongCat | 28.1±8.0 | $0.52 | est.~79 | 2/7 benchmarks measured | Verified | |||
| 81 | NVIDIA | 27.9±8.0 | $0.45 | 164 | 2/7 benchmarks measured | Verified | ||||
| 82 | Granite 4.2 30BOpen | IBM Granite | 27.3±10.0 | $0.28 | 77 | 1/7 benchmarks measured | Verified | |||
| 83 | Qwen3 Coder NextOpen | Alibaba Qwen | 26.6±8.0 | $0.56 | 126 | 2/7 benchmarks measured | Verified | |||
| 84 | Mistral Large 3Open | Mistral AI | 25.3±6.4 | $0.75 | 77 | 3/7 benchmarks measured | Verified | |||
| 85 | TII (Falcon) | 24.3±10.4 | self-host~$0.17–1.52 | est.~83 | 1/7 benchmarks measured | Lab-reported | ||||
| 86 | NVIDIA | 23.2±8.0 | $0.11 | 267 | 2/7 benchmarks measured | Verified | ||||
| 87 | Devstral 2Open | Mistral AI | 22.5±6.4 | self-host~$0.53–5.07 | est.~84 | 3/7 benchmarks measured | Verified | |||
| 88 | NVIDIA | 22.1±8.0 | $0.09 | 245 | 2/7 benchmarks measured | Verified | ||||
| 89 | Granite 4.2 8BOpen | IBM Granite | 22.1±8.0 | $0.11 | 83 | 2/7 benchmarks measured | Verified | |||
| 90 | K2 Horizon 7BOpen | MBZUAI Institute of Foundation Models | 21.4±8.0 | self-host~$0.083–0.74 | est.~100 | 2/7 benchmarks measured | Verified | |||
| 91 | Llama 4 MaverickOpen | Meta | 21.1±6.4 | $0.42 | 114 | 3/7 benchmarks measured | Verified | |||
| 92 | Devstral Small 2Open | Mistral AI | 20.1±6.4 | self-host~$0.19–1.67 | est.~110 | 3/7 benchmarks measured | Verified | |||
| 93 | MiniCPM5-2BOpen | OpenBMB (MiniCPM) | 18.6±8.0 | self-host~$0.035–0.31 | est.~120 | 2/7 benchmarks measured | Verified | |||
| 94 | Ling 3.0 TinyOpen | inclusionAI (Ant Group) | 18.3±8.0 | self-host~$0.029–0.24 | 31 | 2/7 benchmarks measured | Verified | |||
| 95 | IBM Granite | 17.2±8.0 | $0.05 | 220 | 2/7 benchmarks measured | Verified | ||||
| 96 | K2 Horizon 3.7BOpen | MBZUAI Institute of Foundation Models | 17.2±8.0 | self-host~$0.056–0.50 | est.~110 | 2/7 benchmarks measured | Verified | |||
| 97 | Ministral 3 14BOpen | Mistral AI | 16.1±6.4 | $0.20 | 87 | 3/7 benchmarks measured | Verified | |||
| 98 | Celeris | 15.6±8.0 | $0.33 | 1521 | 2/7 benchmarks measured | Verified | ||||
| 99 | Llama 4 ScoutOpen | Meta | 14.5±6.4 | $0.31 | 107 | 3/7 benchmarks measured | Verified | |||
| 100 | Ministral 3 8BOpen | Mistral AI | 14.1±6.4 | $0.15 | 87 | 3/7 benchmarks measured | Verified | |||
| 101 | Ministral 3 3BOpen | Mistral AI | 11.2±6.4 | $0.10 | 231 | 3/7 benchmarks measured | Verified | |||
| 102 | K2 Horizon 0.9BOpen | MBZUAI Institute of Foundation Models | 9.2±8.0 | self-host~$0.021–0.18 | est.~140 | 2/7 benchmarks measured | Verified | |||
| 103 | LFM2.5-2.6BOpen | Liquid AI | 6.3±8.1 | self-host~$0.037–0.33 | est.~120 | 1/7 benchmarks measured | Verified |
About coding
Agentic software engineering and code generation. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology
- SWE-bench Verified(day 0)
- SWE-bench Pro (Public)(day 0)
- DeepSWE v1.1(day 0)
- Terminal-Bench 4.0(day 0)
- LiveCodeBench(third-party)
- SciCode(third-party)
- AA Coding Agent Index(third-party)
Not comparable across labs (1)
Kept for reference, not counted in rankings: these use a lab-specific task set, answer key or scoring, so scores can't be compared fairly across labs. Only published scores are shown.
Day-0 (model cards) Third-party
- Fully verified
- 64%
- of 103 models