‹返回
诗评榜

品鉴力评测

诗评榜

谁最有品鉴力 —— 十一家模型双盲给同一批诗打分(同门互不打分),谁的打分最贴近全场共识,谁就是最靠谱的评委。

二〇二六年九月榜 · 数据截至 2026-09-24 · 与诗才榜同一批作品共用打分

诗评榜 · 最佳评委

诗评榜与诗才榜共用同一批双盲打分:每位评委按《格律诗诗评标准 v1》对每首作品打 0–100 分,取该评委打分与「全场共识」(去掉本评委与作者后的均分)之间的平均绝对偏差(MAD)。偏差越小,说明判断越贴近公论——故本榜数值越小越靠前。

#评委公司发布 与共识偏差(MAD)95% 置信区间打分数平均给分尺度偏移去偏移偏差倾向自评护短
1gpt-6-astraOpenAI2026-09-034.37[3.85, 4.99]19464.7-1.854.10偏苛+0.0
2kimi-k3月之暗面2026-07-164.56[4.08, 5.06]19668.0-0.434.57偏苛+3.0
3doubao-seed-2.1字节2026-06-284.71[4.23, 5.21]19668.6+0.464.71居中+2.5
4muse-spark-1.2Meta2026-08-055.39[4.89, 5.93]19469.4+0.075.39偏宽+3.7
5hunyuan-hy4-preview腾讯2026-08-285.63[5.02, 6.23]19469.2-0.445.62居中+3.6
6gemini-3.8-flashGoogle2026-09-026.05[5.52, 6.59]19471.8+4.364.56最宽+0.0
7qwen3.8-max阿里2026-08-036.28[5.67, 6.95]19672.2+4.814.97最宽+5.0
8deepseek-v4-pro-0813深度求索2026-08-137.59[6.72, 8.52]19471.0+3.366.37偏宽+6.8
9grok-4.7xAI2026-09-218.17[7.50, 8.87]19461.2-7.804.13最苛+0.0
10glm-5.3智谱2026-08-1810.02[9.27, 10.70]19475.7+9.264.86最宽+11.0

数值为「与共识的平均绝对偏差」,越小越贴近公论;kimi-k3(4.61)、GPT-6 Astra(4.84)与 doubao(4.85)区间重叠,为并列最佳评委;Gemini 3.8 Flash(5.89)列第五,Fable 5.1(9.30)尺度偏严而垫底。最贴近共识不等于「打分最准的绝对真理」——它衡量的是与群体判断的一致度。诗才榜写得最好的席位,未必是诗评榜看得最准的席位(glm-5.3 写诗第二,评诗却位列末段)。

方法要点

完整八条设计原则见 榜单设计原则;各模型完成本套测评的实际调用费用见成本榜(参考)。