Skip to content
Model Pareto

Hard reasoning models ranked by quality, price and speed

BenchmarkScienceMathOther

Quality vs price

13 models on the frontier — nothing else is both cheaper and better.

Lower price is better. Pareto frontier: Gemma 4 E4B, Sarvam 30B, Qwen3.5 4B, Sarvam 105B, Ling 3.0 Flash, MiMo-V2.5, GPT-6 Luna, Qwen3.8 Flash-Next, GLM-5.3 Flash, MiMo-V2.6-Pro, Muse Spark 1.3, Claude Sonnet 5.5, Claude Opus 5.5.

  • Best-value frontier (nothing is both cheaper and better)
  • Evidencestrong → weak
  • Estimated from other categories
  • Estimated (price or speed)

Ranking · 182 models

Price $/M tokens (blended 3:1) · Speed output tokens/s

Hard reasoning ranking. Column headers sort the table. Expand a row to see per-benchmark scores.
Select to compareSourceDetails
199.9±2.6$8.00922/4 benchmarks measuredVerified
295.7±3.7$20.0663/4 benchmarks measuredVerified
395.3±4.9$4.00est.~792/4 benchmarks measuredVerified
493.5±3.7$20.0523/4 benchmarks measuredVerified
591.7±3.7$10.0543/4 benchmarks measuredVerified
686.9±3.7$2.002193/4 benchmarks measuredVerified
7
MiMo-V2.6-ProFrontierOpen
86.1±5.1$0.54492/4 benchmarks measuredVerified
885.8±5.1$4.001102/4 benchmarks measuredVerified
983.4±3.7$6.00373/4 benchmarks measuredVerified
1083.2±4.0$1.43853/4 benchmarks measuredMixed
1182.9±3.7$1.502913/4 benchmarks measuredVerified
1282.2±3.7$3.00603/4 benchmarks measuredVerified
1382.1±3.7$3.00393/4 benchmarks measuredVerified
1481.8±5.1$3.00402/4 benchmarks measuredVerified
1581.0±3.7$2.15573/4 benchmarks measuredVerified
1680.1±3.7$4.50833/4 benchmarks measuredVerified
1779.9±3.7$11.3913/4 benchmarks measuredVerified
1878.9±6.6$1.25est.~782/4 benchmarks measuredLab-reported
1978.8±3.7$3.00383/4 benchmarks measuredVerified
2078.5±5.8$4.811452/4 benchmarks measuredVerified
21
GLM-5.3 FlashFrontierOpen
77.9±3.7$0.24463/4 benchmarks measuredVerified
2276.5±3.7$4.00793/4 benchmarks measuredVerified
2376.1±4.0$0.522323/4 benchmarks measuredMixed
24
Qwen3.8 Flash-NextFrontierOpen
76.0±3.7$0.23543/4 benchmarks measuredVerified
2575.8±3.7$4.501203/4 benchmarks measuredVerified
2675.6±3.7$1.98973/4 benchmarks measuredVerified
2773.5±6.6$0.23est.~542/4 benchmarks measuredLab-reported
28
GPT-6 LunaFrontier
72.4±5.1$0.201322/4 benchmarks measuredVerified
2972.0±5.8$1.25552/4 benchmarks measuredVerified
3070.7±3.7$0.521183/4 benchmarks measuredVerified
3169.8±3.7$1.13433/4 benchmarks measuredVerified
3269.3±5.8self-host~$0.13–1.19est.~962/4 benchmarks measuredVerified
3368.6±5.8$0.522062/4 benchmarks measuredVerified
3468.3±5.8self-host~$0.20–1.76est.~922/4 benchmarks measuredVerified
3565.8±3.7self-host~$0.17–1.38est.~883/4 benchmarks measuredVerified
3665.6±3.7$0.70653/4 benchmarks measuredVerified
3765.4±3.7$1.71663/4 benchmarks measuredVerified
3864.7±5.8$0.52932/4 benchmarks measuredVerified
3964.6±3.6$1.761844/4 benchmarks measuredMixed
4064.3±3.7$0.97est.~1003/4 benchmarks measuredVerified
41
Hy3Open
64.1±3.7$0.25863/4 benchmarks measuredVerified
42
A.X-K2Open
63.9±5.8self-host~$0.25–2.21est.~842/4 benchmarks measuredVerified
4363.4±5.8self-host~$0.12–1.11est.~942/4 benchmarks measuredVerified
44
MiMo-V2.5FrontierOpen
61.2±5.8$0.18402/4 benchmarks measuredVerified
4560.2±3.7$1.692173/4 benchmarks measuredVerified
4659.8±10.0self-host~$0.067–0.60est.~1101/4 benchmarks measuredLab-reported
4759.6±4.5$0.21353/4 benchmarks measuredMixed
4858.9±3.7$1.072153/4 benchmarks measuredVerified
49
Ling 3.0 FlashFrontierOpen
58.7±5.8$0.113462/4 benchmarks measuredVerified
5057.7±3.7$1.35863/4 benchmarks measuredVerified
5156.5±3.7$0.111473/4 benchmarks measuredVerified
5256.2±3.7$0.52est.~793/4 benchmarks measuredVerified
5356.1±3.7self-host~$0.053–0.44est.~1103/4 benchmarks measuredVerified
5455.9±3.7$0.461653/4 benchmarks measuredVerified
5555.4±5.8$3.501432/4 benchmarks measuredVerified
5655.4±5.8$0.441902/4 benchmarks measuredVerified
5754.3±3.7$11.31233/4 benchmarks measuredVerified
5854.0±3.6$0.581334/4 benchmarks measuredMixed
5953.6±8.6self-host~$0.046–0.38est.~1201/4 benchmarks measuredLab-reported
6052.5±3.7$1.101293/4 benchmarks measuredVerified
6152.3±5.8self-host~$0.29–2.58est.~822/4 benchmarks measuredVerified
6252.0±3.7$0.841203/4 benchmarks measuredVerified
6351.7±3.7$0.853513/4 benchmarks measuredVerified
6451.6±5.8$0.16est.~892/4 benchmarks measuredVerified
6551.6±5.8$0.52est.~1102/4 benchmarks measuredVerified
6651.3±5.1$0.111592/4 benchmarks measuredVerified
6751.1±3.7$0.851193/4 benchmarks measuredVerified
6850.2±3.7$0.901523/4 benchmarks measuredVerified
6950.1±4.3$0.851673/4 benchmarks measuredVerified
7050.1±5.8self-host~$0.061–0.50est.~1102/4 benchmarks measuredVerified
7150.0±5.8$1.50822/4 benchmarks measuredVerified
7248.2±5.8$0.15602/4 benchmarks measuredVerified
7347.8±3.4$0.261864/4 benchmarks measuredVerified
7447.1±3.7self-host~$0.083–0.74est.~1003/4 benchmarks measuredVerified
7546.9±7.5self-host~$0.12–1.08est.~482/4 benchmarks measuredLab-reported
7646.7±4.3$3.441203/4 benchmarks measuredVerified
7745.6±3.7$0.451643/4 benchmarks measuredVerified
7845.5±5.8self-host~$0.17–1.49est.~842/4 benchmarks measuredVerified
7945.2±5.8self-host~$0.047–0.42est.~1102/4 benchmarks measuredVerified
8044.5±5.8self-host~$0.066–0.59est.~1102/4 benchmarks measuredVerified
8143.9±3.6$3.001494/4 benchmarks measuredMixed
8242.0±5.8self-host~$0.044–0.37est.~2102/4 benchmarks measuredVerified
8341.7±5.8$1.25est.~822/4 benchmarks measuredVerified
8441.6±5.8self-host~$0.12–0.97est.~972/4 benchmarks measuredVerified
8541.0±3.4$2.001094/4 benchmarks measuredVerified
8640.5±3.6$0.261704/4 benchmarks measuredMixed
8739.7±5.8self-host~$0.12–1.09est.~942/4 benchmarks measuredVerified
88
Sarvam 105BFrontierOpen
39.0±5.8$0.07est.~992/4 benchmarks measuredVerified
8938.9±3.7$0.393373/4 benchmarks measuredVerified
9038.9±5.8$0.85est.~872/4 benchmarks measuredVerified
9138.6±3.4$0.101814/4 benchmarks measuredVerified
9238.4±3.7self-host~$0.19–1.562143/4 benchmarks measuredVerified
9338.3±3.7self-host~$0.056–0.50est.~1103/4 benchmarks measuredVerified
9438.2±5.8$0.85est.~1702/4 benchmarks measuredVerified
9537.7±5.8$1.50422/4 benchmarks measuredVerified
9636.7±5.8self-host~$0.029–0.24312/4 benchmarks measuredVerified
9736.4±5.8self-host~$0.36–3.22est.~742/4 benchmarks measuredVerified
9836.4±5.8self-host~$0.091–0.81est.~1202/4 benchmarks measuredVerified
9936.3±4.3$0.75est.~1103/4 benchmarks measuredVerified
10036.2±3.7$0.112673/4 benchmarks measuredVerified
10135.6±5.8$0.411582/4 benchmarks measuredVerified
10235.5±5.8self-host~$0.062–0.56est.~892/4 benchmarks measuredVerified
103
Qwen3.5 4BFrontierOpen
35.5±5.8$0.06232/4 benchmarks measuredVerified
10435.3±5.8$0.25est.~1202/4 benchmarks measuredVerified
105
K2-V2Open
35.3±5.8self-host~$0.35–3.09est.~752/4 benchmarks measuredVerified
10635.2±3.7self-host~$0.044–0.37933/4 benchmarks measuredVerified
10734.9±5.8$0.49est.~792/4 benchmarks measuredVerified
10834.6±3.7$0.092453/4 benchmarks measuredVerified
10934.5±5.8self-host~$0.074–0.66est.~1002/4 benchmarks measuredVerified
11034.1±5.8self-host~$0.12–0.95est.~972/4 benchmarks measuredVerified
11133.7±5.8self-host~$0.88–8.40est.~1102/4 benchmarks measuredVerified
11233.3±3.7$0.561263/4 benchmarks measuredVerified
11333.2±3.7self-host~$0.035–0.31est.~1203/4 benchmarks measuredVerified
11432.9±5.8$0.28772/4 benchmarks measuredVerified
11531.3±5.1$0.347812/4 benchmarks measuredVerified
11630.3±5.8$0.151182/4 benchmarks measuredVerified
11729.8±3.7$0.11833/4 benchmarks measuredVerified
118
Sarvam 30BFrontierOpen
28.7±5.8$0.05est.~1202/4 benchmarks measuredVerified
11928.5±5.8self-host~$0.059–0.52est.~1202/4 benchmarks measuredVerified
12026.9±5.8self-host~$0.17–1.50est.~832/4 benchmarks measuredVerified
12126.7±5.8self-host~$0.16–1.46est.~902/4 benchmarks measuredVerified
12225.4±3.4$0.75774/4 benchmarks measuredVerified
12325.4±5.8self-host~$0.16–1.46est.~842/4 benchmarks measuredVerified
12425.4±5.8$0.43962/4 benchmarks measuredVerified
12524.5±3.7$0.3315213/4 benchmarks measuredVerified
12624.1±5.8self-host~$0.16–1.46est.~842/4 benchmarks measuredVerified
12723.4±5.8$0.302012/4 benchmarks measuredVerified
12823.4±3.7$0.052203/4 benchmarks measuredVerified
12922.9±4.3$0.421143/4 benchmarks measuredVerified
13022.4±5.8self-host~$0.037–0.33est.~1202/4 benchmarks measuredVerified
13122.1±3.4self-host~$0.53–5.07est.~844/4 benchmarks measuredVerified
132
Gemma 4 E4BFrontierOpen
21.6±5.8$0.04612/4 benchmarks measuredVerified
13321.4±5.8$0.45682/4 benchmarks measuredVerified
13421.1±5.8self-host~$0.031–0.26est.~1302/4 benchmarks measuredVerified
13520.9±5.8$0.091552/4 benchmarks measuredVerified
136
Phi-4Open
20.2±5.8$0.22402/4 benchmarks measuredVerified
13720.2±5.8self-host~$0.16–1.46est.~842/4 benchmarks measuredVerified
13819.7±5.8self-host~$0.072–0.64est.~1002/4 benchmarks measuredVerified
13919.4±5.8self-host~$0.047–0.42est.~2002/4 benchmarks measuredVerified
14019.4±3.4$0.20874/4 benchmarks measuredVerified
14119.3±3.4self-host~$0.19–1.67est.~1104/4 benchmarks measuredVerified
14218.6±5.8$0.35est.~892/4 benchmarks measuredVerified
14318.6±5.8$4.38572/4 benchmarks measuredVerified
14418.1±5.8$0.422752/4 benchmarks measuredVerified
14517.4±4.3$0.311073/4 benchmarks measuredVerified
14617.0±8.3self-host~$0.046–0.41est.~582/4 benchmarks measuredLab-reported
14716.7±7.5self-host~$0.17–1.52est.~832/4 benchmarks measuredLab-reported
14816.6±5.8self-host~$0.030–0.27est.~952/4 benchmarks measuredVerified
14916.5±3.4$0.15874/4 benchmarks measuredVerified
15016.1±5.8self-host~$0.35–3.12est.~672/4 benchmarks measuredVerified
15116.1±5.8self-host~$0.051–0.42est.~1202/4 benchmarks measuredVerified
15214.8±5.8self-host~$0.024–0.20est.~1402/4 benchmarks measuredVerified
15314.2±5.8self-host~$0.47–4.23est.~632/4 benchmarks measuredVerified
15413.8±5.8$0.13est.~1002/4 benchmarks measuredVerified
15513.6±5.8self-host~$0.035–0.32est.~962/4 benchmarks measuredVerified
15613.4±5.8self-host~$0.081–0.72est.~1002/4 benchmarks measuredVerified
15712.6±5.8$0.11482/4 benchmarks measuredVerified
15812.5±4.3$0.71853/4 benchmarks measuredVerified
15911.9±5.8self-host~$0.023–0.19est.~1402/4 benchmarks measuredVerified
16011.8±5.8self-host~$0.023–0.19est.~1402/4 benchmarks measuredVerified
16111.8±3.4$0.102314/4 benchmarks measuredVerified
16211.7±5.8self-host~$0.021–0.18est.~1402/4 benchmarks measuredVerified
16311.3±5.8self-host~$0.55–4.92est.~712/4 benchmarks measuredVerified
16411.1±5.8self-host~$0.024–0.20est.~1402/4 benchmarks measuredVerified
16510.7±5.8self-host~$0.051–0.42est.~962/4 benchmarks measuredVerified
16610.5±5.8$0.062772/4 benchmarks measuredVerified
16710.0±5.8self-host~$0.043–0.38est.~1102/4 benchmarks measuredVerified
1689.5±5.8self-host~$0.041–0.37est.~1202/4 benchmarks measuredVerified
1699.1±5.8self-host~$0.10–0.90est.~972/4 benchmarks measuredVerified
1709.1±5.8self-host~$0.060–0.53172/4 benchmarks measuredVerified
1719.0±5.8self-host~$0.042–0.38est.~1302/4 benchmarks measuredVerified
1728.8±5.8self-host~$0.028–0.23est.~1302/4 benchmarks measuredVerified
1738.8±5.8self-host~$0.011–0.088est.~1502/4 benchmarks measuredVerified
1748.5±5.8$1.34est.~752/4 benchmarks measuredVerified
1758.2±3.7self-host~$0.021–0.18est.~1403/4 benchmarks measuredVerified
1768.0±5.8self-host~$0.018–0.15est.~1102/4 benchmarks measuredVerified
1777.9±5.8self-host~$0.011–0.090est.~1502/4 benchmarks measuredVerified
1787.9±5.8self-host~$0.026–0.21est.~1202/4 benchmarks measuredVerified
1797.4±5.8$0.13est.~1002/4 benchmarks measuredVerified
1807.2±5.8$0.34152/4 benchmarks measuredVerified
1816.8±5.8self-host~$0.077–0.68est.~1002/4 benchmarks measuredVerified
1824.8±5.3self-host~$0.009–0.077est.~1302/4 benchmarks measuredVerified

About hard reasoning

Graduate-level science and competition math. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology

Day-0 (model cards) Third-party

Top quality
Claude Opus 5.5
99.9 / 100
Cheapest on the frontier
Gemma 4 E4B
21.6 quality · $0.04
Newest
Claude Sonnet 5.5
Sep 28, 2026
Fully verified
92%
of 182 models