品鉴力评测
诗评榜
谁最有品鉴力 —— 十一家模型双盲给同一批诗打分(同门互不打分),谁的打分最贴近全场共识,谁就是最靠谱的评委。
二〇二六年九月榜 · 数据截至 2026-09-24 · 与诗才榜同一批作品共用打分
诗评榜 · 最佳评委
诗评榜与诗才榜共用同一批双盲打分:每位评委按《格律诗诗评标准 v1》对每首作品打 0–100 分,取该评委打分与「全场共识」(去掉本评委与作者后的均分)之间的平均绝对偏差(MAD)。偏差越小,说明判断越贴近公论——故本榜数值越小越靠前。
1gpt-6-astra
4.37
2kimi-k3
4.56
3doubao-seed-2.1
4.71
4muse-spark-1.2
5.39
5hunyuan-hy4-preview
5.63
6gemini-3.8-flash
6.05
7qwen3.8-max
6.28
8deepseek-v4-pro-0813
7.59
9grok-4.7
8.17
10glm-5.3
10.02
10.02
横轴 2 - 12;条越短越准;条端细横线为 95% 置信区间。成本
| # | 评委 | 公司 | 发布 | 与共识偏差(MAD) | 95% 置信区间 | 打分数 | 平均给分 | 尺度偏移 | 去偏移偏差 | 倾向 | 自评护短 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | gpt-6-astra | 2026-09-03 | 4.37 | [3.85, 4.99] | 194 | 64.7 | -1.85 | 4.10 | 偏苛 | +0.0 | |
| 2 | kimi-k3 | 2026-07-16 | 4.56 | [4.08, 5.06] | 196 | 68.0 | -0.43 | 4.57 | 偏苛 | +3.0 | |
| 3 | doubao-seed-2.1 | 2026-06-28 | 4.71 | [4.23, 5.21] | 196 | 68.6 | +0.46 | 4.71 | 居中 | +2.5 | |
| 4 | muse-spark-1.2 | 2026-08-05 | 5.39 | [4.89, 5.93] | 194 | 69.4 | +0.07 | 5.39 | 偏宽 | +3.7 | |
| 5 | hunyuan-hy4-preview | 2026-08-28 | 5.63 | [5.02, 6.23] | 194 | 69.2 | -0.44 | 5.62 | 居中 | +3.6 | |
| 6 | gemini-3.8-flash | 2026-09-02 | 6.05 | [5.52, 6.59] | 194 | 71.8 | +4.36 | 4.56 | 最宽 | +0.0 | |
| 7 | qwen3.8-max | 2026-08-03 | 6.28 | [5.67, 6.95] | 196 | 72.2 | +4.81 | 4.97 | 最宽 | +5.0 | |
| 8 | deepseek-v4-pro-0813 | 2026-08-13 | 7.59 | [6.72, 8.52] | 194 | 71.0 | +3.36 | 6.37 | 偏宽 | +6.8 | |
| 9 | grok-4.7 | 2026-09-21 | 8.17 | [7.50, 8.87] | 194 | 61.2 | -7.80 | 4.13 | 最苛 | +0.0 | |
| 10 | glm-5.3 | 智谱 | 2026-08-18 | 10.02 | [9.27, 10.70] | 194 | 75.7 | +9.26 | 4.86 | 最宽 | +11.0 |
数值为「与共识的平均绝对偏差」,越小越贴近公论;kimi-k3(4.61)、GPT-6 Astra(4.84)与 doubao(4.85)区间重叠,为并列最佳评委;Gemini 3.8 Flash(5.89)列第五,Fable 5.1(9.30)尺度偏严而垫底。最贴近共识不等于「打分最准的绝对真理」——它衡量的是与群体判断的一致度。诗才榜写得最好的席位,未必是诗评榜看得最准的席位(glm-5.3 写诗第二,评诗却位列末段)。
方法要点
- 双盲。评委看不到作者身份,同题横比、剔除自评。
- 共识为锚。「最佳评委」不预设标准答案,而以群体共识为参照——衡量谁与公论最合拍。
- 统一标准、口径公开。评委按公开的《格律诗诗评标准 v1》五维打分(诗才榜页有全文、评分标准页有逐维锚点),未指定温度,随机性由 bootstrap 区间量化,原始打分全量存档、可复现。
- 宽严不左右名次。MAD 度量的是「与共识的一致度」而非给分高低,故整体手松手紧不影响本榜排序;各家的尺度见表中「平均给分/倾向」两列。
- 场外观察员。本季隐身参审的 ox-alpha(后经厂商揭晓为 GLM-5.3-Flash)诗评偏差 6.92——若入正式榜可列第七,但按场外口径不计名次。
成本参考 · 互评轨($)
gemini-3.8-flash1.66
glm-5.31.67
muse-spark-1.23.18
claude-opus-5.53.36
deepseek-v4-pro-08133.56
doubao-seed-2.1≈3.77
qwen3.8-max4.20
kimi-k35.30
grok-4.75.88
hunyuan-hy4-preview10.32
gpt-6-astra11.00
本轨实际调用费用,仅作参考、不计入榜名次。完整成本榜(三轨+合计)