Vision models ranked by quality, price and speed
Quality vs price
10 models on the frontier — nothing else is both cheaper and better.
Lower price is better. Pareto frontier: Gemma 4 E4B, Qwen3.5 4B, Ling-3.0-flash-VL, MiMo-V2.5, GPT-6 Luna, Qwen3.8-Omni-Flash, Gemini 3.8 Flash, GPT-6 Sol, Claude Opus 5.5, GPT-6 Astra.
- Best-value frontier (nothing is both cheaper and better)
- Evidencestrong → weak
- Estimated from other categories
- Estimated (price or speed)
- Hover a dot for details · click a lab to highlight it
Ranking · 82 models
Price $/M tokens (blended 3:1) · Speed output tokens/s
| Select to compare | Source | Details | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 AstraFrontier | OpenAI | 98.9±3.0 | $20.0 | 52 | 3/6 benchmarks measured | Verified | |||
| 2 | Claude Opus 5.5Frontier | Anthropic | 94.5±4.8 | $8.00 | 92 | 3/6 benchmarks measured | Verified | |||
| 3 | Anthropic | 87.4±7.3 | $20.0 | 66 | 2/6 benchmarks measured | Verified | ||||
| 4 | GPT-6 SolFrontier | OpenAI | 86.8±4.8 | $4.00 | 110 | 3/6 benchmarks measured | Verified | |||
| 5 | Gemini 3.8 FlashFrontier | Google DeepMind | 82.6±4.2 | $1.50 | 291 | 4/6 benchmarks measured | Mixed | |||
| 6 | Meta | 79.1±4.8 | $2.00 | 219 | 3/6 benchmarks measured | Verified | ||||
| 7 | Qwen3.8-Omni-FlashFrontier | Alibaba Qwen | 78.6±10.2 | $0.23 | est.~54 | 1/6 benchmarks measured | Lab-reported | |||
| 8 | OpenAI | 78.1±4.8 | $4.50 | 83 | 3/6 benchmarks measured | Verified | ||||
| 9 | Anthropic | 77.4±4.8 | $10.0 | 54 | 3/6 benchmarks measured | Verified | ||||
| 10 | Alibaba Qwen | 77.3±4.8 | $3.00 | 39 | 3/6 benchmarks measured | Verified | ||||
| 11 | Kimi K3Open | Moonshot AI (Kimi) | 77.0±3.9 | $6.00 | 37 | 5/6 benchmarks measured | Mixed | |||
| 12 | MiMo-V2.6-ProOpen | Xiaomi MiMo | 76.5±9.4 | $0.54 | 49 | 1/6 benchmarks measured | Verified | |||
| 13 | Intern-S2-397BOpen | Shanghai AI Lab (Intern) | 75.3±8.7 | self-host~$0.20–1.76 | est.~92 | 1/6 benchmarks measured | Lab-reported | |||
| 14 | OpenAI | 74.4±4.8 | $11.3 | 91 | 3/6 benchmarks measured | Verified | ||||
| 15 | OpenAI | 73.3±8.2 | $4.81 | 145 | 1/6 benchmarks measured | Verified | ||||
| 16 | Alibaba Qwen | 72.6±5.3 | $0.23 | 54 | 3/6 benchmarks measured | Mixed | ||||
| 17 | Qwen3.8 27BOpen | Alibaba Qwen | 69.0±5.3 | $1.13 | 43 | 3/6 benchmarks measured | Mixed | |||
| 18 | GPT-6 LunaFrontier | OpenAI | 68.8±4.8 | $0.20 | 132 | 3/6 benchmarks measured | Verified | |||
| 19 | Google DeepMind | 68.6±4.0 | $4.50 | 120 | 4/6 benchmarks measured | Verified | ||||
| 20 | StepFun | 66.1±6.3 | $1.43 | 85 | 2/6 benchmarks measured | Verified | ||||
| 21 | SpaceXAI (xAI) | 65.2±7.3 | $3.00 | 60 | 2/6 benchmarks measured | Verified | ||||
| 22 | Shanghai AI Lab (Intern) | 64.3±8.7 | self-host~$0.046–0.38 | est.~120 | 1/6 benchmarks measured | Lab-reported | ||||
| 23 | SpaceXAI (xAI) | 64.1±7.3 | $3.00 | 40 | 2/6 benchmarks measured | Verified | ||||
| 24 | MiniMax-M3Open | MiniMax | 63.8±5.3 | $0.52 | 118 | 3/6 benchmarks measured | Mixed | |||
| 25 | Apodex | 63.5±8.2 | $0.97 | est.~100 | 1/6 benchmarks measured | Verified | ||||
| 26 | SpaceXAI (xAI) | 62.9±8.2 | $1.25 | 55 | 1/6 benchmarks measured | Verified | ||||
| 27 | Alibaba Qwen | 62.9±6.3 | $0.70 | 65 | 2/6 benchmarks measured | Verified | ||||
| 28 | GLM-5.3 FlashOpen | Z.ai (Zhipu) | 62.1±7.3 | $0.24 | 46 | 2/6 benchmarks measured | Verified | |||
| 29 | Step 3.7 FlashOpen | StepFun | 60.8±8.2 | $0.44 | 190 | 1/6 benchmarks measured | Verified | |||
| 30 | Inkling SmallOpen | Thinking Machines Lab | 60.3±8.2 | $0.52 | 206 | 1/6 benchmarks measured | Verified | |||
| 31 | Xiaomi MiMo | 59.9±8.2 | $0.18 | 40 | 1/6 benchmarks measured | Verified | ||||
| 32 | Alibaba Qwen | 59.1±6.2 | $1.35 | 86 | 2/6 benchmarks measured | Verified | ||||
| 33 | OpenAI | 58.4±6.3 | $1.69 | 217 | 2/6 benchmarks measured | Verified | ||||
| 34 | Gemma 4 31BOpen | Google DeepMind | 57.5±8.2 | $0.21 | 35 | 1/6 benchmarks measured | Verified | |||
| 35 | DeepSeek | 56.4±4.8 | $0.52 | 232 | 3/6 benchmarks measured | Verified | ||||
| 36 | Anthropic | 56.2±4.2 | $4.00 | 79 | 4/6 benchmarks measured | Mixed | ||||
| 37 | OpenAI | 56.0±8.2 | $3.50 | 143 | 1/6 benchmarks measured | Verified | ||||
| 38 | inclusionAI (Ant Group) | 54.2±6.3 | $0.11 | 147 | 2/6 benchmarks measured | Verified | ||||
| 39 | Alibaba Qwen | 53.3±8.2 | $1.50 | 82 | 1/6 benchmarks measured | Verified | ||||
| 40 | InklingOpen | Thinking Machines Lab | 52.3±4.2 | $1.76 | 184 | 4/6 benchmarks measured | Mixed | |||
| 41 | Gemma 4 26B A4BOpen | Google DeepMind | 52.1±8.2 | $0.16 | est.~89 | 1/6 benchmarks measured | Verified | |||
| 42 | Google DeepMind | 51.3±4.2 | $0.85 | 351 | 4/6 benchmarks measured | Mixed | ||||
| 43 | Qwen3.5 9BOpen | Alibaba Qwen | 50.5±8.2 | $0.15 | 60 | 1/6 benchmarks measured | Verified | |||
| 44 | Muse GlimmerOpen | Meta | 49.0±3.9 | $0.58 | 133 | 5/6 benchmarks measured | Mixed | |||
| 45 | Qwen3.6 35B A3BOpen | Alibaba Qwen | 48.6±6.3 | $0.84 | 120 | 2/6 benchmarks measured | Verified | |||
| 46 | Amazon Nova | 48.5±8.2 | $3.44 | 120 | 1/6 benchmarks measured | Verified | ||||
| 47 | Amazon Nova | 47.2±8.2 | $0.85 | 167 | 1/6 benchmarks measured | Verified | ||||
| 48 | EXAONE 4.5 33BOpen | LG AI Research (EXAONE) | 47.1±8.2 | self-host~$0.17–1.49 | est.~84 | 1/6 benchmarks measured | Verified | |||
| 49 | Alibaba Qwen | 46.1±6.3 | $1.10 | 129 | 2/6 benchmarks measured | Verified | ||||
| 50 | OpenAI | 43.9±6.3 | $0.46 | 165 | 2/6 benchmarks measured | Verified | ||||
| 51 | Google DeepMind | 43.5±8.2 | self-host~$0.062–0.56 | est.~89 | 1/6 benchmarks measured | Verified | ||||
| 52 | Amazon Nova | 42.2±8.2 | $0.85 | est.~170 | 1/6 benchmarks measured | Verified | ||||
| 53 | Step3 VL 10BOpen | StepFun | 39.2±8.2 | self-host~$0.091–0.81 | est.~120 | 1/6 benchmarks measured | Verified | |||
| 54 | Mistral AI | 38.4±6.3 | $3.00 | 149 | 2/6 benchmarks measured | Verified | ||||
| 55 | Alibaba Qwen | 37.5±8.2 | $0.06 | 23 | 1/6 benchmarks measured | Verified | ||||
| 56 | Gemma 4 12BOpen | Google DeepMind | 36.5±8.2 | $0.15 | 118 | 1/6 benchmarks measured | Verified | |||
| 57 | Anthropic | 36.3±4.1 | $2.00 | 109 | 4/6 benchmarks measured | Mixed | ||||
| 58 | Command A+Open | Cohere | 33.5±6.3 | self-host~$0.19–1.56 | 214 | 2/6 benchmarks measured | Verified | |||
| 59 | Mistral AI | 32.2±8.2 | $0.75 | est.~110 | 1/6 benchmarks measured | Verified | ||||
| 60 | Llama 4 MaverickOpen | Meta | 32.1±6.7 | $0.42 | 114 | 2/6 benchmarks measured | Mixed | |||
| 61 | Alibaba Qwen | 29.4±8.2 | $0.43 | 96 | 1/6 benchmarks measured | Verified | ||||
| 62 | NVIDIA | 29.0±8.2 | $0.42 | 275 | 1/6 benchmarks measured | Verified | ||||
| 63 | Mistral Small 4Open | Mistral AI | 28.3±5.2 | $0.26 | 170 | 3/6 benchmarks measured | Verified | |||
| 64 | Mistral Large 3Open | Mistral AI | 27.7±4.8 | $0.75 | 77 | 3/6 benchmarks measured | Verified | |||
| 65 | NVIDIA | 27.2±8.2 | $0.30 | 201 | 1/6 benchmarks measured | Verified | ||||
| 66 | Llama 4 ScoutOpen | Meta | 26.2±8.2 | $0.31 | 107 | 1/6 benchmarks measured | Verified | |||
| 67 | Google DeepMind | 25.9±8.2 | $0.04 | 61 | 1/6 benchmarks measured | Verified | ||||
| 68 | Ministral 3 14BOpen | Mistral AI | 23.5±6.3 | $0.20 | 87 | 2/6 benchmarks measured | Verified | |||
| 69 | Ministral 3 8BOpen | Mistral AI | 21.1±6.2 | $0.15 | 87 | 2/6 benchmarks measured | Verified | |||
| 70 | Devstral Small 2Open | Mistral AI | 20.6±6.3 | self-host~$0.19–1.67 | est.~110 | 2/6 benchmarks measured | Verified | |||
| 71 | Qwen3.5 2BOpen | Alibaba Qwen | 20.3±8.2 | self-host~$0.030–0.27 | est.~95 | 1/6 benchmarks measured | Verified | |||
| 72 | GLM-4.6VOpen | Z.ai (Zhipu) | 19.7±8.2 | $0.45 | 68 | 1/6 benchmarks measured | Verified | |||
| 73 | Gemma 4 E2BOpen | Google DeepMind | 19.6±8.2 | self-host~$0.035–0.32 | est.~96 | 1/6 benchmarks measured | Verified | |||
| 74 | Meta | 18.8±8.2 | self-host~$0.47–4.23 | est.~63 | 1/6 benchmarks measured | Verified | ||||
| 75 | OpenBMB (MiniCPM) | 17.6±8.2 | self-host~$0.024–0.20 | est.~140 | 1/6 benchmarks measured | Verified | ||||
| 76 | Molmo2-8BOpen | Ai2 (Allen Institute) | 17.2±8.2 | self-host~$0.081–0.72 | est.~100 | 1/6 benchmarks measured | Verified | |||
| 77 | Ministral 3 3BOpen | Mistral AI | 16.5±6.3 | $0.10 | 231 | 2/6 benchmarks measured | Verified | |||
| 78 | Meta | 13.3±8.2 | $0.34 | 15 | 1/6 benchmarks measured | Verified | ||||
| 79 | LFM2.5-VL-1.6BOpen | Liquid AI | 11.8±8.2 | self-host~$0.028–0.23 | est.~130 | 1/6 benchmarks measured | Verified | |||
| 80 | Qwen3.5 0.8BOpen | Alibaba Qwen | 11.4±8.2 | self-host~$0.018–0.15 | est.~110 | 1/6 benchmarks measured | Verified | |||
| 81 | Molmo 7B-DOpen | Ai2 (Allen Institute) | 10.8±8.2 | self-host~$0.077–0.68 | est.~100 | 1/6 benchmarks measured | Verified | |||
| 82 | Microsoft AI | 5.9±7.1 | self-host~$0.060–0.53 | 17 | 1/6 benchmarks measured | Verified |
About vision
Image understanding, documents, and charts. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology
- MMMU(day 0)
- MMMU-Pro(day 0)
- CharXiv Reasoning(day 0)
- OmniDocBench v1.5(third-party)
- GDP.pdf (AA)(third-party)
- Chartography(third-party)
Not comparable across labs (1)
Kept for reference, not counted in rankings: these use a lab-specific task set, answer key or scoring, so scores can't be compared fairly across labs. Only published scores are shown.
Day-0 (model cards) Third-party
- Fully verified
- 83%
- of 82 models