‹返回
诗才榜

律绝写作评测

诗才榜

谁最会写诗 —— 现场命题创作律绝,引擎判律作门槛,双盲多模型互评比风骨。

二〇二六年九月榜 · 数据截至 2026-09-24 · 引擎判律 + 双盲多评委 · 按《格律诗诗评标准 v1》五维评分

诗才榜 · 谁写得最好

参评模型各出一题(管理员按公开原则筛选,不合格责令重出,回避自题),每家就七绝、七律各写若干首,一次成型不挑选。评委按公开的《格律诗诗评标准 v1》五维打分(立意 25/意境 25/语言 20/章法 20/余味 10,另有加减分),写诗前即公示该评分标准。诗才分=全席评委去自评、去同门后的均分×声律系数(出律作品×0.75)·百分制;95% 区间由 bootstrap 得出。

#模型公司发布 诗才分95% 置信区间绝句律诗零出律重字率
1gpt-6-astraOpenAI2026-09-0383.3[82.3, 84.5]83.683.0100%0%
2claude-opus-5.5Anthropic2026-09-2282.7[79.7, 84.9]80.984.495%5%
3glm-5.3智谱2026-08-1873.5[71.2, 75.7]74.172.8100%0%
4qwen3.8-max阿里2026-08-0369.1[66.2, 72.1]69.069.1100%0%
5gemini-3.8-flashGoogle2026-09-0269.0[65.5, 72.5]71.067.0100%0%
6deepseek-v4-pro-0813深度求索2026-08-1367.8[65.2, 70.5]69.965.8100%0%
7doubao-seed-2.1字节2026-06-2865.1[61.6, 68.3]66.963.4100%0%
8kimi-k3月之暗面2026-07-1663.0[59.0, 67.0]67.358.7100%0%
9grok-4.7xAI2026-09-2160.4[50.7, 68.9]58.862.160%10%
10muse-spark-1.2Meta2026-08-0555.1[51.7, 58.1]56.753.4100%0%

诗才榜 GPT-6 Astra(82.9)一席领先,区间与任何一席都不重叠;第二梯队 Fable 5.1(75.4)、glm-5.3(73.8)区间重叠,为统计并列;Gemini 3.8 Flash(69.0)以 Flash 之身列第五。「绝句/律诗」=分体诗才分,「零出律」=作品经引擎判律全对的比例。另据对照,自评护短指数(自评分减他评均分,正数=给自己打高分)以 gpt-5.6-sol(+9.8)与 glm-5.3(+9.8)最重,gemini-3.8-flash(+0.0)最公允,claude-fable-5.1(−5.5)反而对自己更苛刻——榜面分数均已剔除自评,自评护短不影响名次。

怎么评

评审口径(全文公开)

评委系统提示词与锚点全文公开、原始打分全量存档,结论以区间口径可复现:

系统提示(节录):「你是一位严谨、公正的诗词评审。请仅依据作品本身的文本质量评分,不要臆测或参考任何作者信息。【格律由确定性规则引擎另行核验计分——评审不评格律,不因格律/平仄/押韵问题扣分】。请你依据自己的诗词鉴赏标准,对这首作品做整体评判,给出一个 0 到 100 的总分……请用满整个分数区间、拉开作品之间的差距。」

评分锚点:95-100=可入选诗集的精品,几无瑕疵;85-94=优秀,有明显亮点但仍可打磨;70-84=合格,达意但有不足;60-69=及格线附近,有明显硬伤;59 分及以下=较差或近乎打油。

评审调用未指定温度(各按厂商默认;部分推理型号不接受该参数),打分随机性由 bootstrap 置信区间量化;提示词与原始打分全量存档,结论以区间口径可复现。

披露

评委的评分准头单列在 诗评榜;完整设计原则见 榜单设计原则;各模型完成本套测评的实际调用费用见成本榜(参考)。