Skip to content
Model Pareto

Vision models ranked by quality, price and speed

BenchmarkImage reasoningDocuments & charts

Quality vs price

10 models on the frontier — nothing else is both cheaper and better.

Lower price is better. Pareto frontier: Gemma 4 E4B, Qwen3.5 4B, Ling-3.0-flash-VL, MiMo-V2.5, GPT-6 Luna, Qwen3.8-Omni-Flash, Gemini 3.8 Flash, GPT-6 Sol, Claude Opus 5.5, GPT-6 Astra.

  • Best-value frontier (nothing is both cheaper and better)
  • Evidencestrong → weak
  • Estimated from other categories
  • Estimated (price or speed)

Ranking · 82 models

Price $/M tokens (blended 3:1) · Speed output tokens/s

Vision ranking. Column headers sort the table. Expand a row to see per-benchmark scores.
Select to compareSourceDetails
1
GPT-6 AstraFrontier
98.9±3.0$20.0523/6 benchmarks measuredVerified
294.5±4.8$8.00923/6 benchmarks measuredVerified
387.4±7.3$20.0662/6 benchmarks measuredVerified
4
GPT-6 SolFrontier
86.8±4.8$4.001103/6 benchmarks measuredVerified
582.6±4.2$1.502914/6 benchmarks measuredMixed
679.1±4.8$2.002193/6 benchmarks measuredVerified
778.6±10.2$0.23est.~541/6 benchmarks measuredLab-reported
878.1±4.8$4.50833/6 benchmarks measuredVerified
977.4±4.8$10.0543/6 benchmarks measuredVerified
1077.3±4.8$3.00393/6 benchmarks measuredVerified
1177.0±3.9$6.00375/6 benchmarks measuredMixed
1276.5±9.4$0.54491/6 benchmarks measuredVerified
1375.3±8.7self-host~$0.20–1.76est.~921/6 benchmarks measuredLab-reported
1474.4±4.8$11.3913/6 benchmarks measuredVerified
1573.3±8.2$4.811451/6 benchmarks measuredVerified
1672.6±5.3$0.23543/6 benchmarks measuredMixed
1769.0±5.3$1.13433/6 benchmarks measuredMixed
18
GPT-6 LunaFrontier
68.8±4.8$0.201323/6 benchmarks measuredVerified
1968.6±4.0$4.501204/6 benchmarks measuredVerified
2066.1±6.3$1.43852/6 benchmarks measuredVerified
2165.2±7.3$3.00602/6 benchmarks measuredVerified
2264.3±8.7self-host~$0.046–0.38est.~1201/6 benchmarks measuredLab-reported
2364.1±7.3$3.00402/6 benchmarks measuredVerified
2463.8±5.3$0.521183/6 benchmarks measuredMixed
2563.5±8.2$0.97est.~1001/6 benchmarks measuredVerified
2662.9±8.2$1.25551/6 benchmarks measuredVerified
2762.9±6.3$0.70652/6 benchmarks measuredVerified
2862.1±7.3$0.24462/6 benchmarks measuredVerified
2960.8±8.2$0.441901/6 benchmarks measuredVerified
3060.3±8.2$0.522061/6 benchmarks measuredVerified
31
MiMo-V2.5FrontierOpen
59.9±8.2$0.18401/6 benchmarks measuredVerified
3259.1±6.2$1.35862/6 benchmarks measuredVerified
3358.4±6.3$1.692172/6 benchmarks measuredVerified
3457.5±8.2$0.21351/6 benchmarks measuredVerified
3556.4±4.8$0.522323/6 benchmarks measuredVerified
3656.2±4.2$4.00794/6 benchmarks measuredMixed
3756.0±8.2$3.501431/6 benchmarks measuredVerified
38
Ling-3.0-flash-VLFrontierOpen
54.2±6.3$0.111472/6 benchmarks measuredVerified
3953.3±8.2$1.50821/6 benchmarks measuredVerified
4052.3±4.2$1.761844/6 benchmarks measuredMixed
4152.1±8.2$0.16est.~891/6 benchmarks measuredVerified
4251.3±4.2$0.853514/6 benchmarks measuredMixed
4350.5±8.2$0.15601/6 benchmarks measuredVerified
4449.0±3.9$0.581335/6 benchmarks measuredMixed
4548.6±6.3$0.841202/6 benchmarks measuredVerified
4648.5±8.2$3.441201/6 benchmarks measuredVerified
4747.2±8.2$0.851671/6 benchmarks measuredVerified
4847.1±8.2self-host~$0.17–1.49est.~841/6 benchmarks measuredVerified
4946.1±6.3$1.101292/6 benchmarks measuredVerified
5043.9±6.3$0.461652/6 benchmarks measuredVerified
5143.5±8.2self-host~$0.062–0.56est.~891/6 benchmarks measuredVerified
5242.2±8.2$0.85est.~1701/6 benchmarks measuredVerified
5339.2±8.2self-host~$0.091–0.81est.~1201/6 benchmarks measuredVerified
5438.4±6.3$3.001492/6 benchmarks measuredVerified
55
Qwen3.5 4BFrontierOpen
37.5±8.2$0.06231/6 benchmarks measuredVerified
5636.5±8.2$0.151181/6 benchmarks measuredVerified
5736.3±4.1$2.001094/6 benchmarks measuredMixed
5833.5±6.3self-host~$0.19–1.562142/6 benchmarks measuredVerified
5932.2±8.2$0.75est.~1101/6 benchmarks measuredVerified
6032.1±6.7$0.421142/6 benchmarks measuredMixed
6129.4±8.2$0.43961/6 benchmarks measuredVerified
6229.0±8.2$0.422751/6 benchmarks measuredVerified
6328.3±5.2$0.261703/6 benchmarks measuredVerified
6427.7±4.8$0.75773/6 benchmarks measuredVerified
6527.2±8.2$0.302011/6 benchmarks measuredVerified
6626.2±8.2$0.311071/6 benchmarks measuredVerified
67
Gemma 4 E4BFrontierOpen
25.9±8.2$0.04611/6 benchmarks measuredVerified
6823.5±6.3$0.20872/6 benchmarks measuredVerified
6921.1±6.2$0.15872/6 benchmarks measuredVerified
7020.6±6.3self-host~$0.19–1.67est.~1102/6 benchmarks measuredVerified
7120.3±8.2self-host~$0.030–0.27est.~951/6 benchmarks measuredVerified
7219.7±8.2$0.45681/6 benchmarks measuredVerified
7319.6±8.2self-host~$0.035–0.32est.~961/6 benchmarks measuredVerified
7418.8±8.2self-host~$0.47–4.23est.~631/6 benchmarks measuredVerified
7517.6±8.2self-host~$0.024–0.20est.~1401/6 benchmarks measuredVerified
7617.2±8.2self-host~$0.081–0.72est.~1001/6 benchmarks measuredVerified
7716.5±6.3$0.102312/6 benchmarks measuredVerified
7813.3±8.2$0.34151/6 benchmarks measuredVerified
7911.8±8.2self-host~$0.028–0.23est.~1301/6 benchmarks measuredVerified
8011.4±8.2self-host~$0.018–0.15est.~1101/6 benchmarks measuredVerified
8110.8±8.2self-host~$0.077–0.68est.~1001/6 benchmarks measuredVerified
825.9±7.1self-host~$0.060–0.53171/6 benchmarks measuredVerified

About vision

Image understanding, documents, and charts. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology

Not comparable across labs (1)

Kept for reference, not counted in rankings: these use a lab-specific task set, answer key or scoring, so scores can't be compared fairly across labs. Only published scores are shown.

Day-0 (model cards) Third-party

Top quality
GPT-6 Astra
98.9 / 100
Cheapest on the frontier
Gemma 4 E4B
25.9 quality · $0.04
Newest
Claude Opus 5.5
Sep 22, 2026
Fully verified
83%
of 82 models