格律判断与驾驭评测
格律榜 · 判律榜 / 控律榜
谁最懂格律 —— 格律榜下辖两榜:判律榜命大模型像规则引擎一样,逐字判断一首近体诗的格律对错;控律榜命它按令写诗、外科手术式地驾驭规则。会判不等于会写,故两榜各评各分、一榜一冠军,分列不并。
二〇二六年九月榜 · 数据截至 2026-09-24 · 裁判为确定性规则引擎
判律榜 · 谁读得懂谱
给一首律诗或绝句,模型须逐字判定七类格律问题——平仄有误(并指出具体错字)、用韵、孤平、三平尾、三仄尾、失粘、重字。综合分=七类判定的 F1 宏平均×100;错字分=平仄错字定位的字级 F1×100(多音字不计分)。
横轴自 75 起;条端细横线为 95% 置信区间。成本
| # | 模型 | 公司 | 发布 | 综合分 | 95% 置信区间 | 错字 | 有效卷 | 平仄 | 用韵 | 孤平 | 三平 | 三仄 | 失粘 | 重字 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | doubao-seed-2.1 | 2026-06-28 | 88.9 | [85.8, 91.1] | 70.1 | 221 | 71.9 | 100 | 75.4 | 87.3 | 98.2 | 89.6 | 100 | |
| 2 | claude-opus-5.5 | 2026-09-22 | 88.7 | [85.8, 91.2] | 51.9 | 212 | 66.7 | 100 | 82.4 | 81.3 | 98.3 | 92.1 | 100 | |
| 3 | qwen3.8-max | 2026-08-03 | 88.2 | [85.7, 90.6] | 65.5 | 207 | 72.6 | 98.2 | 68.6 | 93.1 | 97.9 | 88.9 | 98.2 | |
| 4 | grok-4.7 | 2026-09-21 | 87.6 | [84.8, 90.0] | 73.4 | 236 | 73.7 | 92.3 | 77.9 | 81.6 | 98.4 | 89.6 | 100 | |
| 5 | deepseek-v4-pro-0813 | 2026-08-13 | 87.4 | [84.6, 89.9] | 68.5 | 233 | 66.7 | 98.4 | 77.9 | 83.8 | 98.3 | 87 | 100 | |
| 6 | kimi-k3 | 2026-07-16 | 86.5 | [83.2, 89.3] | 66.3 | 215 | 73.2 | 91.8 | 72.2 | 82.9 | 95.8 | 89.6 | 100 | |
| 7 | hunyuan-hy4-preview | 2026-08-28 | 86.3 | [83.5, 88.9] | 66.4 | 232 | 71.6 | 93.5 | 74.1 | 81.6 | 96.7 | 87 | 100 | |
| 8 | gemini-3.8-flash | 2026-09-02 | 86.2 | [83.1, 89.3] | 54.3 | 201 | 67.7 | 93.9 | 76.1 | 83.1 | 98.2 | 86.4 | 98.1 | |
| 9 | gpt-6-astra | 2026-09-03 | 84.4 | [81.4, 87.1] | 56.1 | 208 | 55.7 | 100 | 66.7 | 82.4 | 98.2 | 87.7 | 100 | |
| 10 | muse-spark-1.2 | 2026-08-05 | 83.8 | [80.8, 86.5] | 61.8 | 234 | 55.8 | 87.5 | 76.3 | 81.6 | 98.4 | 87 | 100 |
95% bootstrap 置信区间重叠视为统计并列——判律榜前四名(豆包、通义千问、深度求索、Fable)区间彼此重叠,为统计并列的第一梯队。错字分单列,衡量能否精确指到出错的那一个字。后列七项为各类判定的 F1(%)——用韵、三仄尾、重字近乎人人全对,把各家拉开差距的是平仄错字、孤平与失粘。
控律榜 · 谁驾驭得住规则
命模型按令写诗——要么写一首完全合律的,要么写一首「只带指定的某一种病、其余全对」的。引擎逐字核验它到底做没做到,三档评分(写出指定病且不含其它病=满分;意外附带别的病=半分;没写出=零分)。这一步装不出来:不彻底吃透规则,就没法精准地只违反其中一条。
86.6
横轴自 70 起;条端细横线为 95% 置信区间。成本
| # | 模型 | 公司 | 发布 | 控律分 | 95% 置信区间 | 合律 | 平仄 | 用韵 | 孤平 | 三平 | 三仄 | 失粘 | 重字 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | qwen3.8-max | 2026-08-03 | 93.7 | [89.7, 97.6] | 100 | 100 | 88 | 100 | 95 | 100 | 75 | 100 | |
| 2 | gpt-6-astra | 2026-09-03 | 93.6 | [89.7, 97.1] | 100 | 100 | 100 | 85 | 90 | 100 | 80 | 100 | |
| 3 | claude-opus-5.5 | 2026-09-22 | 89.4 | [84.9, 93.8] | 100 | 95 | 78 | 95 | 95 | 95 | 68 | 100 | |
| 4 | gemini-3.8-flash | 2026-09-02 | 89.1 | [84.2, 93.4] | 90 | 98 | 100 | 95 | 90 | 88 | 62 | 100 | |
| 5 | kimi-k3 | 2026-07-16 | 88.9 | [84.1, 93.4] | 95 | 95 | 92 | 100 | 85 | 90 | 65 | 98 | |
| 6 | deepseek-v4-pro-0813 | 2026-08-13 | 87.7 | [82.3, 92.7] | 100 | 95 | 75 | 85 | 100 | 95 | 65 | 98 | |
| 7 | glm-5.3 | 智谱 | 2026-08-18 | 86.6 | [81.0, 91.5] | 100 | 95 | 90 | 75 | 80 | 85 | 75 | 100 |
| 8 | grok-4.7 | 2026-09-21 | 83.5 | [78.6, 88.9] | 80 | 100 | 92 | 78 | 100 | 80 | 55 | 95 | |
| 9 | hunyuan-hy4-preview | 2026-08-28 | 83.5 | [77.8, 88.7] | 100 | 95 | 65 | 90 | 90 | 80 | 60 | 100 | |
| 10 | doubao-seed-2.1 | 2026-06-28 | 79.6 | [73.9, 85.1] | 95 | 90 | 75 | 75 | 90 | 80 | 48 | 100 |
控律分按难度加权(实证权=各类犯成率的倒数,>0.2 截断):白给的重字、三尾不当噪声算,通盘推演的孤平、失粘权重最高。每类 20 首、全卷 160 首;后列各数为该类合规率(%)。区间重叠视为统计并列——榜首一片区间几乎全部重叠,控律仍是全行业的难关,失粘一列尤其普遍偏低。
方法要点
- 裁判是规则。七类问题全部由确定性规则引擎逐字判定,同一首诗结果永远一致,不含随机性,也不由语言模型「感觉」对错。
- 题目 100% 现场生成。命参评模型就古人未写过的现代题材现场作诗,查重防回流后入库;作品在测评发生前不存在于世上任何角落,构造上免疫训练污染。
- 一厂一席、同门新版取代。每家只留最强的一个在架版本;同厂新版发布当日或次日纳入、旧版退役(如 deepseek-v4-pro-0813、grok-4.6、glm-5.3 取代 glm-5.2)。同门择优亦按点估计定席(阿里席由 max 88.2 胜开源 2.4t 86.5、Anthropic 席由 Fable 胜 Opus)。
- 接入通道。各大模型通过 OpenRouter 或 302.AI 聚合通道调用。
披露与勘误
- 控律口径变更。控律成绩自本次起按升级后的规则引擎计算。引擎补充了词组级多音字定读与韵脚一致性定读,原先因多音字读音未定而无法判断的句子现在可以判断,此前未能识别的孤平、失粘、三平尾与三仄尾现在能够识别,因此全席控律分数普遍上调,与此前公布的数值不可直接比较。判律榜不受影响:判律题目的标准答案在出卷时即已固定,评分不调用引擎重算,本次全部席位的判律分数与此前公布值逐位一致。
- 题库独立性。本期判律题库存在近重复族群(同一底稿变造出多个变体,独立性受限),bootstrap 置信区间因此略偏乐观;下季起每份底稿限一变体。
- 补答规则。标准档两次调用失败或超时的题目,统一以 40K token / 900 秒放宽档补答一次;「有效卷」列即计入补答后成功成文的题数,各席答题数因此不同。
- 季中口径升级。韵脚一致性定读、失粘与相关判定同源不双罚等规则在本季施行;判律 #49 因多音字定读后暴露真三平尾,全体答卷据金标准统一重判,名次无变化。
- 标准化校验。以 z 分数标准化重算,十席名次与生分口径完全一致。
完整八条设计原则见 榜单设计原则;各模型完成本套测评的实际调用费用见成本榜(参考)。你也可以打开格律检查工具,亲手拿任意一首诗验证裁判。
成本参考 · 判律轨($)
本轨实际调用费用,仅作参考、不计入榜名次。完整成本榜(三轨+合计)