Skip to content
Model Pareto

Coding models ranked by quality, price and speed

BenchmarkAgentic codingCode generation

Quality vs price

10 models on the frontier — nothing else is both cheaper and better.

Lower price is better. Pareto frontier: Granite 4.2 3B, NVIDIA Nemotron 3 Nano 30B A3B, gpt-oss-20b, Ling-3.0-flash-VL, MiMo-V2.6-Flash, GLM-5.3 Flash, DeepSeek V4.1 Flash, MiMo-V2.6-Pro, Claude Sonnet 5.5, Claude Opus 5.5.

  • Best-value frontier (nothing is both cheaper and better)
  • Evidencestrong → weak
  • Estimated from other categories
  • Estimated (price or speed)

Ranking · 103 models

Price $/M tokens (blended 3:1) · Speed output tokens/s

Coding ranking. Column headers sort the table. Expand a row to see per-benchmark scores.
Select to compareSourceDetails
196.9±3.4$8.00925/7 benchmarks measuredMixed
291.7±5.2$4.00est.~794/7 benchmarks measuredMixed
387.5±3.6$20.0665/7 benchmarks measuredMixed
486.2±4.5$20.0524/7 benchmarks measuredVerified
583.3±3.2$10.0546/7 benchmarks measuredMixed
678.7±4.5$4.001104/7 benchmarks measuredVerified
7
MiMo-V2.6-ProFrontierOpen
77.8±6.4$0.54493/7 benchmarks measuredMixed
874.9±4.5$2.002194/7 benchmarks measuredVerified
974.0±4.5$2.15574/7 benchmarks measuredVerified
1073.7±6.4$1.43853/7 benchmarks measuredMixed
1172.7±4.5$3.00404/7 benchmarks measuredVerified
1269.8±5.2$4.50834/7 benchmarks measuredMixed
1367.4±8.6$1.25est.~782/7 benchmarks measuredLab-reported
1466.4±6.4$0.522323/7 benchmarks measuredMixed
15
GLM-5.3 FlashFrontierOpen
65.9±6.4$0.24463/7 benchmarks measuredMixed
1665.2±4.5$6.00374/7 benchmarks measuredVerified
17
MiMo-V2.6-FlashFrontierOpen
63.7±6.4$0.18553/7 benchmarks measuredMixed
1863.1±8.6$0.23est.~542/7 benchmarks measuredLab-reported
1962.1±10.5self-host~$0.067–0.60est.~1101/7 benchmarks measuredLab-reported
2062.0±5.2$0.23544/7 benchmarks measuredMixed
2161.6±8.6self-host~$0.20–1.76est.~922/7 benchmarks measuredLab-reported
2260.2±5.2$11.3914/7 benchmarks measuredMixed
2360.1±10.4self-host~$0.30–2.69est.~811/7 benchmarks measuredLab-reported
2459.1±4.5$3.00394/7 benchmarks measuredVerified
2559.0±4.5$3.00604/7 benchmarks measuredVerified
2658.3±4.5$1.502914/7 benchmarks measuredVerified
2756.6±5.4$4.00794/7 benchmarks measuredMixed
2855.6±6.4$3.00383/7 benchmarks measuredMixed
2954.0±8.5self-host~$0.20–1.76est.~922/7 benchmarks measuredLab-reported
3052.5±4.5$0.201324/7 benchmarks measuredVerified
3151.7±5.4$4.501204/7 benchmarks measuredMixed
3251.4±4.5$1.98974/7 benchmarks measuredVerified
3350.1±8.0$11.31232/7 benchmarks measuredVerified
3447.3±10.0self-host~$0.12–1.11est.~941/7 benchmarks measuredVerified
3545.7±10.4self-host~$0.12–1.08est.~481/7 benchmarks measuredLab-reported
3645.2±8.0$1.692172/7 benchmarks measuredVerified
3744.1±5.4$0.521184/7 benchmarks measuredMixed
3844.0±8.0$0.522062/7 benchmarks measuredVerified
3943.9±5.2$1.13434/7 benchmarks measuredMixed
4041.2±10.0self-host~$0.13–1.19est.~961/7 benchmarks measuredVerified
4140.5±10.0self-host~$0.20–1.76est.~921/7 benchmarks measuredVerified
4240.3±10.0$0.441901/7 benchmarks measuredVerified
4340.2±8.0$1.71662/7 benchmarks measuredVerified
4439.6±6.5$0.21353/7 benchmarks measuredMixed
4539.5±8.0$0.70652/7 benchmarks measuredVerified
4639.3±5.4$1.761844/7 benchmarks measuredMixed
4739.1±8.0$0.901522/7 benchmarks measuredVerified
4838.3±8.0$0.461652/7 benchmarks measuredVerified
4937.5±8.0$0.52932/7 benchmarks measuredVerified
5037.4±8.0$0.97est.~1002/7 benchmarks measuredVerified
5137.1±5.4$1.072154/7 benchmarks measuredMixed
5236.7±8.6self-host~$0.046–0.38est.~1202/7 benchmarks measuredLab-reported
5336.6±8.0$1.35862/7 benchmarks measuredVerified
54
A.X-K2Open
36.3±10.0self-host~$0.25–2.21est.~841/7 benchmarks measuredVerified
5536.3±8.0self-host~$0.17–1.38est.~882/7 benchmarks measuredVerified
5636.2±8.0$0.18402/7 benchmarks measuredVerified
5736.0±10.0self-host~$0.29–2.58est.~821/7 benchmarks measuredVerified
5835.9±5.4$0.581334/7 benchmarks measuredMixed
5935.7±8.0$0.851192/7 benchmarks measuredVerified
60
Ling-3.0-flash-VLFrontierOpen
35.6±8.0$0.111472/7 benchmarks measuredVerified
61
Hy3Open
34.4±4.3$0.25865/7 benchmarks measuredMixed
6234.4±10.0$0.16est.~891/7 benchmarks measuredVerified
6334.3±8.0$0.113462/7 benchmarks measuredVerified
6434.1±6.6$3.001493/7 benchmarks measuredMixed
6534.0±6.5$0.853513/7 benchmarks measuredMixed
66
gpt-oss-20bFrontierOpen
33.6±6.4$0.101813/7 benchmarks measuredVerified
6733.4±8.0$0.111592/7 benchmarks measuredVerified
6833.1±5.2$2.001094/7 benchmarks measuredMixed
6931.9±8.0self-host~$0.053–0.44est.~1102/7 benchmarks measuredVerified
7031.8±8.0$1.101292/7 benchmarks measuredVerified
7131.1±8.0$0.393372/7 benchmarks measuredVerified
7230.8±6.5$0.261703/7 benchmarks measuredMixed
7330.2±8.6self-host~$0.046–0.38est.~1202/7 benchmarks measuredLab-reported
7430.2±5.2$0.261864/7 benchmarks measuredMixed
7529.6±8.0self-host~$0.19–1.562142/7 benchmarks measuredVerified
7629.1±8.0self-host~$0.044–0.37932/7 benchmarks measuredVerified
7729.0±8.0$0.841202/7 benchmarks measuredVerified
7828.7±10.0self-host~$0.061–0.50est.~1101/7 benchmarks measuredVerified
7928.1±8.0$0.347812/7 benchmarks measuredVerified
8028.1±8.0$0.52est.~792/7 benchmarks measuredVerified
8127.9±8.0$0.451642/7 benchmarks measuredVerified
8227.3±10.0$0.28771/7 benchmarks measuredVerified
8326.6±8.0$0.561262/7 benchmarks measuredVerified
8425.3±6.4$0.75773/7 benchmarks measuredVerified
8524.3±10.4self-host~$0.17–1.52est.~831/7 benchmarks measuredLab-reported
8623.2±8.0$0.112672/7 benchmarks measuredVerified
8722.5±6.4self-host~$0.53–5.07est.~843/7 benchmarks measuredVerified
8822.1±8.0$0.092452/7 benchmarks measuredVerified
8922.1±8.0$0.11832/7 benchmarks measuredVerified
9021.4±8.0self-host~$0.083–0.74est.~1002/7 benchmarks measuredVerified
9121.1±6.4$0.421143/7 benchmarks measuredVerified
9220.1±6.4self-host~$0.19–1.67est.~1103/7 benchmarks measuredVerified
9318.6±8.0self-host~$0.035–0.31est.~1202/7 benchmarks measuredVerified
9418.3±8.0self-host~$0.029–0.24312/7 benchmarks measuredVerified
95
Granite 4.2 3BFrontierOpen
17.2±8.0$0.052202/7 benchmarks measuredVerified
9617.2±8.0self-host~$0.056–0.50est.~1102/7 benchmarks measuredVerified
9716.1±6.4$0.20873/7 benchmarks measuredVerified
9815.6±8.0$0.3315212/7 benchmarks measuredVerified
9914.5±6.4$0.311073/7 benchmarks measuredVerified
10014.1±6.4$0.15873/7 benchmarks measuredVerified
10111.2±6.4$0.102313/7 benchmarks measuredVerified
1029.2±8.0self-host~$0.021–0.18est.~1402/7 benchmarks measuredVerified
1036.3±8.1self-host~$0.037–0.33est.~1201/7 benchmarks measuredVerified

About coding

Agentic software engineering and code generation. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology

Not comparable across labs (1)

Kept for reference, not counted in rankings: these use a lab-specific task set, answer key or scoring, so scores can't be compared fairly across labs. Only published scores are shown.

Day-0 (model cards) Third-party

Top quality
Claude Opus 5.5
96.9 / 100
Cheapest on the frontier
Granite 4.2 3B
17.2 quality · $0.05
Newest
Claude Sonnet 5.5
Sep 28, 2026
Fully verified
64%
of 103 models