成本榜(参考) · 二〇二六年九月榜
完成同一套测评(判律+写诗+互评三轨),各家模型的实际调用费用并不相同——差异主要来自思考文本的用量:同一道题,有的模型要想三倍长。此榜按「谁最省」排序,供性价比参考,不计入任何能力榜名次。
1deepseek-v4-pro-0813
7.63
2glm-5.3
8.26
8.26
3gemini-3.8-flash
8.36
4claude-opus-5.5
10.38
5muse-spark-1.2
12.10
6doubao-seed-2.1
≈23.83
7qwen3.8-max
25.12
8grok-4.7
26.96
9gpt-6-astra
29.31
10hunyuan-hy4-preview
31.43
11kimi-k3
34.21
条长即合计费用(美元),越短越省。豆包费用为估算(≈)。写诗$≈ 为折算估计:首期十席按补漏批校准,本期新入席(Fable 5.1、Gemini 3.8 Flash、混元 hy4)按互评$×0.86 折算。
| 模型 | 公司 | 判律$ | 互评$ | 写诗$≈ | 合计$ | 指数 | 占比 |
|---|---|---|---|---|---|---|---|
| deepseek-v4-pro-0813 | 2.14 | 3.56 | 1.93 | 7.63 | 1.0 | 3.5% | |
| glm-5.3 | 智谱 | 6.10 | 1.67 | 0.49 | 8.26 | 1.1 | 3.8% |
| gemini-3.8-flash | 5.72 | 1.66 | 0.98 | 8.36 | 1.1 | 3.8% | |
| claude-opus-5.5 | 4.13 | 3.36 | 2.89 | 10.38 | 1.4 | 4.8% | |
| muse-spark-1.2 | 7.80 | 3.18 | 1.12 | 12.10 | 1.6 | 5.6% | |
| doubao-seed-2.1 | ≈17.40 | ≈3.77 | 2.66 | ≈23.83 | 3.1 | 11.0% | |
| qwen3.8-max | 18.94 | 4.20 | 1.98 | 25.12 | 3.3 | 11.5% | |
| grok-4.7 | 16.02 | 5.88 | 5.06 | 26.96 | 3.5 | 12.4% | |
| gpt-6-astra | 12.46 | 11.00 | 5.85 | 29.31 | 3.8 | 13.5% | |
| hunyuan-hy4-preview | 14.83 | 10.32 | 6.28 | 31.43 | 4.1 | 14.4% | |
| kimi-k3 | 26.72 | 5.30 | 2.19 | 34.21 | 4.5 | 15.7% |
11 席合计约 $208.3。指数=合计费用/最省者(deepseek-v4-pro-0813=1.0);占比=占 11 席合计。
分轨成本排名
三轨各自从省到贵排一遍——判律轨对应格律榜、写诗轨对应诗才榜、互评轨对应诗评榜。三张图横轴各自独立、均自 0 起。
1deepseek-v4-pro-0813
2.14
2claude-opus-5.5
4.13
3gemini-3.8-flash
5.72
4glm-5.3
6.10
6.10
5muse-spark-1.2
7.80
6gpt-6-astra
12.46
7hunyuan-hy4-preview
14.83
8grok-4.7
16.02
9doubao-seed-2.1
≈17.40
10qwen3.8-max
18.94
11kimi-k3
26.72
对应格律榜。
1glm-5.3
0.49
0.49
2gemini-3.8-flash
0.98
3muse-spark-1.2
1.12
4deepseek-v4-pro-0813
1.93
5qwen3.8-max
1.98
6kimi-k3
2.19
7doubao-seed-2.1
2.66
8claude-opus-5.5
2.89
9grok-4.7
5.06
10gpt-6-astra
5.85
11hunyuan-hy4-preview
6.28
对应诗才榜;全轨为折算估计。
1gemini-3.8-flash
1.66
2glm-5.3
1.67
1.67
3muse-spark-1.2
3.18
4claude-opus-5.5
3.36
5deepseek-v4-pro-0813
3.56
6doubao-seed-2.1
≈3.77
7qwen3.8-max
4.20
8kimi-k3
5.30
9grok-4.7
5.88
10hunyuan-hy4-preview
10.32
11gpt-6-astra
11.00
对应诗评榜。
诗画榜成本(首期,参考)
诗画榜两轨各自排一遍:出图轨=该席画满 20 首画题的费用;评图轨=该评委评完 20 次「一诗一调用」(每次 7–8 幅画)的费用。本期出图合计 ≈$6.05、评图 ≈$23.5。
1muse-image
0.20
2gpt-image-2.5-sunburst
0.67
3mai-image-2.6
0.81
4grok-imagine-image-2.0
1.20
5gemini-3.1-flash-image
1.35
6qwen-image-3-pro
1.50
对应诗画榜参赛席。字节席经 302.AI 聚合通道出图,该通道对其未计费(22 次调用记 0),不入图;末位席不点名、不列。
| 图像模型 | 公司 | 出图$ | 单幅$ |
|---|---|---|---|
| muse-image | 0.20 | 0.010 | |
| gpt-image-2.5-sunburst | 0.67 | 0.033 | |
| mai-image-2.6 | 0.81 | 0.041 | |
| grok-imagine-image-2.0 | 1.20 | 0.060 | |
| gemini-3.1-flash-image | 1.35 | 0.067 | |
| qwen-image-3-pro | 1.50 | 0.075 | |
| seedream-5-0-pro | 0(通道未计费) | — |
1deepseek-vision
0.26
2glm-5v-turbo
0.66
0.66
3gemini-3.8-flash
0.74
4qwen3.8-max
1.49
5doubao-seed-2.1
≈1.50
6claude-fable-5.1
8.22
7gpt-6-astra
10.61
对应诗画榜评委席。豆包经 302.AI 评图,网关不回传单次费用,按其控制台三日合计 ÷ 调用次数折算(≈)。
| 评委 | 公司 | 评图$ | 单次$ | 秒/次 |
|---|---|---|---|---|
| deepseek-vision | 0.26 | 0.013 | 143 | |
| glm-5v-turbo | 智谱 | 0.66 | 0.033 | 152 |
| gemini-3.8-flash | 0.74 | 0.037 | 67 | |
| qwen3.8-max | 1.49 | 0.074 | 234 | |
| doubao-seed-2.1 | ≈1.50 | ≈0.075 | 443 | |
| claude-fable-5.1 | 8.22 | 0.411 | 108 | |
| gpt-6-astra | 10.61 | 0.530 | 216 |
评图比出图贵得多:看图模型按输入图片计费,一次调用送 7–8 幅画;GPT-6 Astra 与 Fable 5.1 两席合计占评图费用八成。
怎么读这张表
- 最省与最贵差 5 倍。同样一套题,kimi-k3 花掉 deepseek 的五倍——判律轨它一家就烧了 $26.7,是全场思考文本用量之最。
- 贵未必好,省未必差。kimi-k3 最烧钱,但它的钱花对了地方——诗评榜第一(与共识偏差最小);glm-5.3 评审最便宜(单次评审价仅为最贵者的十四分之一),但诗评偏差居后。
- 性价比之王候选。deepseek-v4-pro-0813 全场最省,判律、诗才两榜均居中游——按「每美元买到的名次」计,本季无出其右。
口径
- 判律轨、互评轨为逐调用实际记账(计费网关回传)。
- 写诗轨本季未逐调用记账,按补录批次的实测总额与各家单次评审价的比例折算(标 ≈,误差约 ±20%);下季起全轨逐调用记账。
- 豆包经聚合通道(302.AI)接入,计费网关不回传单价,其判律/互评费用按逐调用 token 记录 × 302 牌价重算(输入输出按典型比例拆分,标 ≈);聚合通道牌价含平台加成,纵向对比时留意口径。本机参照席与场外观察员不计费。
- 诗画榜两轨:OpenRouter/直连各席逐调用实际记账;经 302.AI 的 OpenAI、末位席出图与豆包评图,网关不回传单次费用,按 302 控制台「按模型消费」汇总(豆包按三日合计 ÷ 48 次折算单次,标 ≈);字节席出图该通道未计费,记 0。
- 金额按测评当时牌价;指数与占比口径不随厂商调价失效。