‹返回
格律榜

格律判断与驾驭评测

格律榜 · 判律榜 / 控律榜

谁最懂格律 —— 格律榜下辖两榜:判律榜命大模型像规则引擎一样,逐字判断一首近体诗的格律对错;控律榜命它按令写诗、外科手术式地驾驭规则。会判不等于会写,故两榜各评各分、一榜一冠军,分列不并。

二〇二六年九月榜 · 数据截至 2026-09-24 · 裁判为确定性规则引擎

判律榜 · 谁读得懂谱

给一首律诗或绝句,模型须逐字判定七类格律问题——平仄有误(并指出具体错字)、用韵、孤平、三平尾、三仄尾、失粘、重字。综合分=七类判定的 F1 宏平均×100;错字分=平仄错字定位的字级 F1×100(多音字不计分)。

#模型公司发布 综合分95% 置信区间错字有效卷平仄用韵孤平三平三仄失粘重字
1doubao-seed-2.1字节2026-06-2888.9[85.8, 91.1]70.122171.910075.487.398.289.6100
2claude-opus-5.5Anthropic2026-09-2288.7[85.8, 91.2]51.921266.710082.481.398.392.1100
3qwen3.8-max阿里2026-08-0388.2[85.7, 90.6]65.520772.698.268.693.197.988.998.2
4grok-4.7xAI2026-09-2187.6[84.8, 90.0]73.423673.792.377.981.698.489.6100
5deepseek-v4-pro-0813深度求索2026-08-1387.4[84.6, 89.9]68.523366.798.477.983.898.387100
6kimi-k3月之暗面2026-07-1686.5[83.2, 89.3]66.321573.291.872.282.995.889.6100
7hunyuan-hy4-preview腾讯2026-08-2886.3[83.5, 88.9]66.423271.693.574.181.696.787100
8gemini-3.8-flashGoogle2026-09-0286.2[83.1, 89.3]54.320167.793.976.183.198.286.498.1
9gpt-6-astraOpenAI2026-09-0384.4[81.4, 87.1]56.120855.710066.782.498.287.7100
10muse-spark-1.2Meta2026-08-0583.8[80.8, 86.5]61.823455.887.576.381.698.487100

95% bootstrap 置信区间重叠视为统计并列——判律榜前四名(豆包、通义千问、深度求索、Fable)区间彼此重叠,为统计并列的第一梯队。错字分单列,衡量能否精确指到出错的那一个字。后列七项为各类判定的 F1(%)——用韵、三仄尾、重字近乎人人全对,把各家拉开差距的是平仄错字、孤平与失粘。

控律榜 · 谁驾驭得住规则

命模型按令写诗——要么写一首完全合律的,要么写一首「只带指定的某一种病、其余全对」的。引擎逐字核验它到底做没做到,三档评分(写出指定病且不含其它病=满分;意外附带别的病=半分;没写出=零分)。这一步装不出来:不彻底吃透规则,就没法精准地只违反其中一条。

#模型公司发布 控律分95% 置信区间合律平仄用韵孤平三平三仄失粘重字
1qwen3.8-max阿里2026-08-0393.7[89.7, 97.6]100100881009510075100
2gpt-6-astraOpenAI2026-09-0393.6[89.7, 97.1]100100100859010080100
3claude-opus-5.5Anthropic2026-09-2289.4[84.9, 93.8]100957895959568100
4gemini-3.8-flashGoogle2026-09-0289.1[84.2, 93.4]909810095908862100
5kimi-k3月之暗面2026-07-1688.9[84.1, 93.4]95959210085906598
6deepseek-v4-pro-0813深度求索2026-08-1387.7[82.3, 92.7]100957585100956598
7glm-5.3智谱2026-08-1886.6[81.0, 91.5]100959075808575100
8grok-4.7xAI2026-09-2183.5[78.6, 88.9]801009278100805595
9hunyuan-hy4-preview腾讯2026-08-2883.5[77.8, 88.7]100956590908060100
10doubao-seed-2.1字节2026-06-2879.6[73.9, 85.1]95907575908048100

控律分按难度加权(实证权=各类犯成率的倒数,>0.2 截断):白给的重字、三尾不当噪声算,通盘推演的孤平、失粘权重最高。每类 20 首、全卷 160 首;后列各数为该类合规率(%)。区间重叠视为统计并列——榜首一片区间几乎全部重叠,控律仍是全行业的难关,失粘一列尤其普遍偏低。

方法要点

披露与勘误

完整八条设计原则见 榜单设计原则;各模型完成本套测评的实际调用费用见成本榜(参考)。你也可以打开格律检查工具,亲手拿任意一首诗验证裁判。