律绝写作评测
诗才榜
谁最会写诗 —— 现场命题创作律绝,引擎判律作门槛,双盲多模型互评比风骨。
二〇二六年九月榜 · 数据截至 2026-09-24 · 引擎判律 + 双盲多评委 · 按《格律诗诗评标准 v1》五维评分
诗才榜 · 谁写得最好
参评模型各出一题(管理员按公开原则筛选,不合格责令重出,回避自题),每家就七绝、七律各写若干首,一次成型不挑选。评委按公开的《格律诗诗评标准 v1》五维打分(立意 25/意境 25/语言 20/章法 20/余味 10,另有加减分),写诗前即公示该评分标准。诗才分=全席评委去自评、去同门后的均分×声律系数(出律作品×0.75)·百分制;95% 区间由 bootstrap 得出。
73.5
横轴自 45 起;条端细横线为 95% 置信区间。成本
| # | 模型 | 公司 | 发布 | 诗才分 | 95% 置信区间 | 绝句 | 律诗 | 零出律 | 重字率 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | gpt-6-astra | 2026-09-03 | 83.3 | [82.3, 84.5] | 83.6 | 83.0 | 100% | 0% | |
| 2 | claude-opus-5.5 | 2026-09-22 | 82.7 | [79.7, 84.9] | 80.9 | 84.4 | 95% | 5% | |
| 3 | glm-5.3 | 智谱 | 2026-08-18 | 73.5 | [71.2, 75.7] | 74.1 | 72.8 | 100% | 0% |
| 4 | qwen3.8-max | 2026-08-03 | 69.1 | [66.2, 72.1] | 69.0 | 69.1 | 100% | 0% | |
| 5 | gemini-3.8-flash | 2026-09-02 | 69.0 | [65.5, 72.5] | 71.0 | 67.0 | 100% | 0% | |
| 6 | deepseek-v4-pro-0813 | 2026-08-13 | 67.8 | [65.2, 70.5] | 69.9 | 65.8 | 100% | 0% | |
| 7 | doubao-seed-2.1 | 2026-06-28 | 65.1 | [61.6, 68.3] | 66.9 | 63.4 | 100% | 0% | |
| 8 | kimi-k3 | 2026-07-16 | 63.0 | [59.0, 67.0] | 67.3 | 58.7 | 100% | 0% | |
| 9 | grok-4.7 | 2026-09-21 | 60.4 | [50.7, 68.9] | 58.8 | 62.1 | 60% | 10% | |
| 10 | muse-spark-1.2 | 2026-08-05 | 55.1 | [51.7, 58.1] | 56.7 | 53.4 | 100% | 0% |
诗才榜 GPT-6 Astra(82.9)一席领先,区间与任何一席都不重叠;第二梯队 Fable 5.1(75.4)、glm-5.3(73.8)区间重叠,为统计并列;Gemini 3.8 Flash(69.0)以 Flash 之身列第五。「绝句/律诗」=分体诗才分,「零出律」=作品经引擎判律全对的比例。另据对照,自评护短指数(自评分减他评均分,正数=给自己打高分)以 gpt-5.6-sol(+9.8)与 glm-5.3(+9.8)最重,gemini-3.8-flash(+0.0)最公允,claude-fable-5.1(−5.5)反而对自己更苛刻——榜面分数均已剔除自评,自评护短不影响名次。
怎么评
- 现场命题、回避自题。每家出一道现代题材题,管理员按公开原则筛选;作诗时回避自己出的题,杜绝「量身定制」。
- 引擎判律作门槛。格律由确定性规则引擎另行核验:出律作品诗才分乘 0.75 系数,评委只评艺术水准、不因格律扣分(两不双罚)。
- 双盲多评委互评。隐去作者身份、同题横比、剔除自评。十一家模型互为评委(同门互不打分),统一提示词、统一锚点,打分随机性由 bootstrap 置信区间量化。
- 自评护短指数。保留少量自评作对照,量化「给自己打高分」的倾向——正得越多护短越重。
评审口径(全文公开)
评委系统提示词与锚点全文公开、原始打分全量存档,结论以区间口径可复现:
系统提示(节录):「你是一位严谨、公正的诗词评审。请仅依据作品本身的文本质量评分,不要臆测或参考任何作者信息。【格律由确定性规则引擎另行核验计分——评审不评格律,不因格律/平仄/押韵问题扣分】。请你依据自己的诗词鉴赏标准,对这首作品做整体评判,给出一个 0 到 100 的总分……请用满整个分数区间、拉开作品之间的差距。」
评分锚点:95-100=可入选诗集的精品,几无瑕疵;85-94=优秀,有明显亮点但仍可打磨;70-84=合格,达意但有不足;60-69=及格线附近,有明显硬伤;59 分及以下=较差或近乎打油。
评审调用未指定温度(各按厂商默认;部分推理型号不接受该参数),打分随机性由 bootstrap 置信区间量化;提示词与原始打分全量存档,结论以区间口径可复现。
披露
- 答题数不同。命题席回避自己出的题,理论上各写 18 首(七绝/七律各一×九题);因个别题目缺答或补答,各席有效作品数为 13–20 首(见「首数」列思路:本页表以「诗才分」为准,首数差异由 bootstrap 区间吸收)。
- 去自评。诗才分与最佳评委共识均以去掉「本人评本人」的打分计算,避免自评污染排名。
- 纯大模型口径。诗才榜不引入人工题库与历史数据,全程由参评模型出题、创作、互评。
- 场外观察员。本季另设一席隐身模型 ox-alpha 以场外身份同题写诗、同卷评审(后经厂商揭晓为 GLM-5.3-Flash):诗才 75.0[72.2, 78.0]、诗评偏差 6.92,与正式席 glm-5.3 的诗才分统计并列、五维画像几乎重合。其成绩不计入任何正式榜名次,仅作口径校验参考。
成本参考 · 写诗轨(折算估计)($)
本轨实际调用费用,仅作参考、不计入榜名次。完整成本榜(三轨+合计)