Skip to content
Model Pareto

Writing & chat models ranked by quality, price and speed

BenchmarkInstruction followingCreative writingTranslationOther

Quality vs price

14 models on the frontier — nothing else is both cheaper and better.

Lower price is better. Pareto frontier: Gemma 4 E4B, Qwen3.5 4B, Gemma 4 12B, Qwen3.5 9B, Gemma 4 26B A4B, GPT-6 Luna, Qwen3.8 Flash-Next, MiMo-V2.6-Pro, Step 5 Preview, GLM-5.3, Kimi K3, Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1.

  • Best-value frontier (nothing is both cheaper and better)
  • Evidencestrong → weak
  • Estimated from other categories
  • Estimated (price or speed)

Ranking · 146 models

Price $/M tokens (blended 3:1) · Speed output tokens/s

Writing & chat ranking. Column headers sort the table. Expand a row to see per-benchmark scores.
Select to compareSourceDetails
197.6±3.5$20.0663/5 benchmarks measuredVerified
293.4±4.3$10.0543/5 benchmarks measuredVerified
393.0±4.3$8.00923/5 benchmarks measuredVerified
492.1±5.3$20.0523/5 benchmarks measuredVerified
5
Kimi K3FrontierOpen
89.1±4.3$6.00373/5 benchmarks measuredVerified
6
GLM-5.3FrontierOpen
86.0±4.3$2.15573/5 benchmarks measuredVerified
783.1±4.3$4.001103/5 benchmarks measuredVerified
8
Step 5 PreviewFrontierEstimated from other categories
82.6±12.7$1.43850/5 benchmarks measuredEstimated
982.3±6.0$3.00392/5 benchmarks measuredVerified
1082.3±4.6$2.002193/5 benchmarks measuredVerified
11
MiMo-V2.6-ProFrontierOpen
81.8±6.0$0.54492/5 benchmarks measuredVerified
12
Qwen3.8 Flash-NextFrontierOpen
80.0±9.7$0.23541/5 benchmarks measuredLab-reported
1378.8±9.7$0.23est.~541/5 benchmarks measuredLab-reported
1478.4±6.0$0.24462/5 benchmarks measuredVerified
1577.8±4.6$1.502913/5 benchmarks measuredVerified
1677.0±3.3$11.3914/5 benchmarks measuredVerified
1776.9±9.5$4.811451/5 benchmarks measuredVerified
1875.4±3.4$4.501205/5 benchmarks measuredMixed
1974.1±6.0$1.98972/5 benchmarks measuredVerified
2073.2±7.3$3.00382/5 benchmarks measuredMixed
2172.9±4.2$0.70653/5 benchmarks measuredVerified
2272.0±6.0$3.00602/5 benchmarks measuredVerified
2371.7±3.3$4.50834/5 benchmarks measuredVerified
2471.0±4.2$0.521183/5 benchmarks measuredVerified
2571.0±4.3$3.00403/5 benchmarks measuredVerified
2669.8±4.3$0.522323/5 benchmarks measuredVerified
2769.1±4.2$1.692173/5 benchmarks measuredVerified
2869.0±4.2$1.35863/5 benchmarks measuredVerified
2968.3±4.3$4.00793/5 benchmarks measuredVerified
30
Hy3Open
67.7±6.0$0.25862/5 benchmarks measuredVerified
3167.7±9.7self-host~$0.046–0.38est.~1201/5 benchmarks measuredLab-reported
3267.4±9.7self-host~$0.067–0.60est.~1101/5 benchmarks measuredLab-reported
33
GPT-6 LunaFrontier
67.2±6.0$0.201322/5 benchmarks measuredVerified
3465.5±9.5$3.441201/5 benchmarks measuredVerified
35
Gemma 4 26B A4BFrontierOpen
64.8±4.5$0.16est.~893/5 benchmarks measuredVerified
3664.4±9.5$3.501431/5 benchmarks measuredVerified
3764.3±3.6$1.13434/5 benchmarks measuredMixed
3863.8±3.6$1.761844/5 benchmarks measuredMixed
3963.5±3.6$0.21355/5 benchmarks measuredMixed
4061.6±4.2$0.18403/5 benchmarks measuredVerified
4161.6±9.5$0.441901/5 benchmarks measuredVerified
4261.4±4.4$0.581334/5 benchmarks measuredMixed
4361.2±9.5$0.851671/5 benchmarks measuredVerified
4461.0±4.3$0.853513/5 benchmarks measuredVerified
4560.7±9.5self-host~$0.20–1.76est.~921/5 benchmarks measuredVerified
4660.7±3.3$1.072154/5 benchmarks measuredVerified
4759.3±9.5self-host~$0.044–0.37est.~2101/5 benchmarks measuredVerified
4858.7±4.2$1.101293/5 benchmarks measuredVerified
4958.3±4.2$3.001493/5 benchmarks measuredVerified
50
Qwen3.5 9BFrontierOpen
56.4±9.5$0.15601/5 benchmarks measuredVerified
5156.4±9.5$1.71661/5 benchmarks measuredVerified
5255.6±4.2$0.461653/5 benchmarks measuredVerified
5353.8±9.5$0.85est.~1701/5 benchmarks measuredVerified
5453.2±9.5$0.52est.~1101/5 benchmarks measuredVerified
5552.9±9.5self-host~$0.12–1.09est.~941/5 benchmarks measuredVerified
5652.0±9.5$0.841201/5 benchmarks measuredVerified
5751.0±9.5self-host~$0.19–1.562141/5 benchmarks measuredVerified
5851.0±9.5$0.451641/5 benchmarks measuredVerified
5950.5±9.5self-host~$0.17–1.49est.~841/5 benchmarks measuredVerified
6050.4±9.5self-host~$0.066–0.59est.~1101/5 benchmarks measuredVerified
6150.3±9.5$1.50821/5 benchmarks measuredVerified
6249.7±3.8$2.001094/5 benchmarks measuredMixed
6347.2±9.5self-host~$0.062–0.56est.~891/5 benchmarks measuredVerified
6445.3±9.5self-host~$0.36–3.22est.~741/5 benchmarks measuredVerified
6545.1±9.5$0.85est.~871/5 benchmarks measuredVerified
6644.1±9.5$0.422751/5 benchmarks measuredVerified
67
K2-V2Open
44.0±9.5self-host~$0.35–3.09est.~751/5 benchmarks measuredVerified
6842.9±9.5self-host~$0.12–0.95est.~971/5 benchmarks measuredVerified
6942.0±4.2$0.411583/5 benchmarks measuredVerified
7040.8±9.5self-host~$0.091–0.81est.~1201/5 benchmarks measuredVerified
7140.8±3.3$0.75774/5 benchmarks measuredVerified
7240.2±9.5self-host~$0.16–1.46est.~901/5 benchmarks measuredVerified
7339.9±9.5self-host~$0.074–0.66est.~1001/5 benchmarks measuredVerified
7439.5±9.5self-host~$0.044–0.37931/5 benchmarks measuredVerified
7539.4±4.2$0.393373/5 benchmarks measuredVerified
7639.2±9.5self-host~$0.047–0.42est.~2001/5 benchmarks measuredVerified
7738.1±3.4$0.261865/5 benchmarks measuredMixed
7838.1±9.5$0.851191/5 benchmarks measuredVerified
7937.4±9.5self-host~$0.031–0.26est.~1301/5 benchmarks measuredVerified
8037.2±9.5$0.261701/5 benchmarks measuredVerified
8136.9±9.5$0.75est.~1101/5 benchmarks measuredVerified
82
Gemma 4 12BFrontierOpen
36.6±9.5$0.151181/5 benchmarks measuredVerified
8335.4±9.5$1.25est.~821/5 benchmarks measuredVerified
8432.6±9.5self-host~$0.059–0.52est.~1201/5 benchmarks measuredVerified
8532.6±9.5self-host~$0.021–0.18est.~1401/5 benchmarks measuredVerified
8632.4±9.5self-host~$0.041–0.37est.~1201/5 benchmarks measuredVerified
87
Qwen3.5 4BFrontierOpen
32.1±9.5$0.06231/5 benchmarks measuredVerified
8831.9±4.2$0.092453/5 benchmarks measuredVerified
8931.4±4.2$0.101813/5 benchmarks measuredVerified
90
Gemma 4 E4BFrontierOpen
30.2±9.5$0.04611/5 benchmarks measuredVerified
9129.8±5.1$0.45683/5 benchmarks measuredVerified
9229.5±9.5self-host~$0.051–0.42est.~1201/5 benchmarks measuredVerified
9329.1±9.5self-host~$0.047–0.42est.~1101/5 benchmarks measuredVerified
9429.0±9.5self-host~$0.17–1.50est.~831/5 benchmarks measuredVerified
9528.5±9.5$0.71851/5 benchmarks measuredVerified
9628.1±9.5$0.49est.~791/5 benchmarks measuredVerified
9728.0±9.5$0.07est.~991/5 benchmarks measuredVerified
9827.6±4.5self-host~$0.12–0.97est.~973/5 benchmarks measuredVerified
9927.5±9.5$0.311071/5 benchmarks measuredVerified
10027.0±9.5$0.561261/5 benchmarks measuredVerified
10126.9±9.5self-host~$0.072–0.64est.~1001/5 benchmarks measuredVerified
10226.8±9.5self-host~$0.023–0.19est.~1401/5 benchmarks measuredVerified
10325.9±5.1self-host~$0.88–8.40est.~1103/5 benchmarks measuredVerified
10425.8±9.5self-host~$0.023–0.19est.~1401/5 benchmarks measuredVerified
10525.6±9.5$1.50421/5 benchmarks measuredVerified
10625.6±9.5self-host~$0.53–5.07est.~841/5 benchmarks measuredVerified
10725.5±9.5$0.43961/5 benchmarks measuredVerified
10825.3±9.5$0.302011/5 benchmarks measuredVerified
10924.7±3.3$0.421144/5 benchmarks measuredVerified
11023.9±4.5$0.25est.~1203/5 benchmarks measuredVerified
11123.6±9.5$4.38571/5 benchmarks measuredVerified
11223.4±4.2self-host~$0.16–1.46est.~843/5 benchmarks measuredVerified
11323.3±4.2self-host~$0.16–1.46est.~843/5 benchmarks measuredVerified
11422.8±9.5self-host~$0.035–0.32est.~961/5 benchmarks measuredVerified
11522.8±9.5self-host~$0.030–0.27est.~951/5 benchmarks measuredVerified
11622.6±9.5self-host~$0.16–1.46est.~841/5 benchmarks measuredVerified
11722.3±9.5$0.20871/5 benchmarks measuredVerified
11821.8±9.5self-host~$0.19–1.67est.~1101/5 benchmarks measuredVerified
11921.0±9.5self-host~$0.55–4.92est.~711/5 benchmarks measuredVerified
12020.2±9.5$0.05est.~1201/5 benchmarks measuredVerified
12120.0±9.5$0.13est.~1001/5 benchmarks measuredVerified
12219.8±9.5$0.15871/5 benchmarks measuredVerified
12319.5±9.5self-host~$0.024–0.20est.~1401/5 benchmarks measuredVerified
12419.3±9.5$0.35est.~891/5 benchmarks measuredVerified
12519.2±9.5self-host~$0.028–0.23est.~1301/5 benchmarks measuredVerified
12619.1±9.5$0.11481/5 benchmarks measuredVerified
12718.6±9.5self-host~$0.35–3.12est.~671/5 benchmarks measuredVerified
12818.5±9.5$0.091551/5 benchmarks measuredVerified
12918.5±5.1self-host~$0.081–0.72est.~1003/5 benchmarks measuredVerified
13017.9±9.5self-host~$0.10–0.90est.~971/5 benchmarks measuredVerified
13117.7±9.5$0.34151/5 benchmarks measuredVerified
13217.3±9.5$0.062771/5 benchmarks measuredVerified
13316.9±9.5$0.102311/5 benchmarks measuredVerified
13416.1±9.5self-host~$0.051–0.42est.~961/5 benchmarks measuredVerified
13516.1±9.5self-host~$0.024–0.20est.~1401/5 benchmarks measuredVerified
13614.5±9.5self-host~$0.026–0.21est.~1201/5 benchmarks measuredVerified
13714.3±9.5$1.34est.~751/5 benchmarks measuredVerified
13814.3±9.5self-host~$0.043–0.38est.~1101/5 benchmarks measuredVerified
13913.9±9.5self-host~$0.018–0.15est.~1101/5 benchmarks measuredVerified
14011.9±9.5$0.13est.~1001/5 benchmarks measuredVerified
14110.9±9.5self-host~$0.077–0.68est.~1001/5 benchmarks measuredVerified
14210.7±9.5self-host~$0.042–0.38est.~1301/5 benchmarks measuredVerified
1439.5±9.5self-host~$0.011–0.088est.~1501/5 benchmarks measuredVerified
1448.3±8.9self-host~$0.011–0.090est.~1501/5 benchmarks measuredVerified
145
Phi-4Open
5.8±4.2$0.22403/5 benchmarks measuredVerified
1465.0±7.3self-host~$0.009–0.077est.~1301/5 benchmarks measuredVerified

About writing & chat

Instruction following, creative writing, and translation. Quality is a weighted average of the benchmarks below, each rescaled so 100 = the best tracked model. Benchmarks without a published score are estimated from related ones (shown dashed). Dot fill shows the evidence: solid = strong, tinted = medium, empty ring = weak (few benchmarks measured, lab-reported only or provisional). Methodology

Day-0 (model cards) Third-party

Top quality
Claude Fable 5.1
97.6 / 100
Cheapest on the frontier
Gemma 4 E4B
30.2 quality · $0.04
Newest
Claude Opus 5.5
Sep 22, 2026
Fully verified
92%
of 146 models