Fable 5.1 上诗韵榜:错字定位大涨、诗才守住榜首,当评委却变成了「严师」
二〇二六年九月二日
9 月 1 日 Anthropic 发布 Claude Fable 5.1。官方材料和随后的各家整理稿谈的是编程、科研、缓存价格和企业部署;我们关心的问题窄得多:一个「.1」升级,在格律诗词这件事上到底动了什么?诗韵榜四榜同卷复测一遍,答案比预想的有意思——三榜守住或略进,一榜从第 3 掉到垫底,而掉的原因恰恰是它「变严了」。
四榜总览:新版、同门旧版、该榜榜首
对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,点估计涨零点几分不算数。方括号是 95% 置信区间。
| Fable 5.1 | Fable 58-23 发布版 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 统计并列 | 88.5#2 · [85.8, 90.8] 错字分 65.8 | 87.3#4 · [84.2, 90.0] 错字分 52.8 | 88.9Doubao 2.1 #1 错字分 70.1 |
| 控律榜控律分 · 实证权 统计并列 | 55.0#6 · [47.9, 62.7] | 51.1#8 · [42.7, 59.0] | 58.6Gemini 3.1 Pro #1 |
| 诗才榜诗才分 · 五维双盲互评 统计并列 | 76.3#1 · [73.9, 78.8] 19 首 | 77.5#1 · [74.6, 80.2] 17 首 | 本人居首第二 GLM-5.3 74.6 |
| 诗评榜与共识偏差 · 越小越准 明显退步 | 10.48#11 垫底 尺度偏移 −10.32 | 4.96#3 · [4.39, 5.52] | 4.71Kimi K3 #1 |
判律:总分并列,错字定位从 52.8 跳到 65.8
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量「平仄有误」这一类里能不能把错字指到位。
综合分 88.5 对 87.3,区间大面积重叠,名次第 4 → 第 2 是挤过了 Qwen 的 88.2 和 DeepSeek 的 87.4,离榜首 Doubao 的 88.9 只差 0.4。真正动了的是错字分:52.8 → 65.8,涨 13.0。这一项旧版在发布版 10 席里排倒数第二,新版进了前列,仍落后榜首 Doubao 的 70.1。
七类判定 F1(判律榜分项)
| Fable 5.1 | Fable 5 | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 76.7全场最高 | 72.1 | 76.7Fable 5.1 |
| 用韵 | 100 | 93.9 | 100并列 |
| 孤平 | 74.7 | 74.7 | 77.9DeepSeek |
| 三平尾 | 81.3 | 81.3 | 93.1Qwen3.8 |
| 三仄尾 | 98.3 | 98.3 | 98.4多席 |
| 失粘 | 90.6全场最高 | 90.6 | 90.6Fable 5.1 |
| 重字 | 98.2 | 100 | 100多席 |
分项看,「平仄有误」76.7 是全场最高,「用韵」判到 100,「失粘」90.6 也是全场最高;孤平、三平尾、三仄尾与旧版一分不差,重字退两分,在噪声里。换句话说,新版把最难的一类(逐字辨平仄)往前推了一截,别的类持平。顺带一提,新版 236 题全部有效作答,同门回避后计 213 题;旧版当期有效卷 213。
控律:写命题诗守规矩,名次升两位,但全榜本就挤在一起
控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,榜首也只有 58.6 分。
八项任务达成率 %(控律榜分项)
| Fable 5.1 | Fable 5 | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 95 | 100 | 100多席 |
| 只犯平仄 | 75 | 85 | 90Kimi |
| 只犯用韵 | 100全场最高 | 80 | 100Fable 5.1 |
| 只犯孤平 | 55 | 40 | 80Kimi |
| 只犯三平尾 | 45 | 25 | 60Grok/GPT |
| 只犯三仄尾 | 80 | 55 | 95多席 |
| 只犯失粘 | 20 | 30 | 35Muse |
| 只犯重字 | 98 | 100 | 100多席 |
55.0 对 51.1,名次第 8 → 第 6,与 Qwen3.8-Max 同分。但要老实说:这张榜从第 1 到第 11 的置信区间几乎全部重叠,任何两席之间都不能称「显著」。能看的是分项:「只犯三仄尾」55 → 80、「只犯三平尾」25 → 45、「只犯孤平」40 → 55、「只犯用韵」80 → 100——这四项都是「故意犯一个指定的病、别的地方不能错」,要求对格律有精确的控制,新版明显更听指挥。代价是「完全合律」100 → 95、「只犯平仄」85 → 75。
「只犯失粘」全场最高 35,新版 20,旧版 30。失粘是通盘推演类的病:要写出一首失粘、又不带任何其他毛病的七绝,等于先把整首正格写对再精确挪一联。这一项目前没有一家过关。
诗才:守住榜首,点估计还低了一分
诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人的分。题目是当期机密,这里不列。
新版 76.3,旧版发布时 77.5,区间重叠,仍是榜首,第二 GLM-5.3 74.6、第三 GPT-5.6 Sol 74.4 都在两三分之内。点估计低了一分,但这一分不能全算在作品头上:评委席换了——新版自己是个严评委(下一节),它给别人打低分的同时,别人的共识也被它拉低;旧版发布时评委席里没有它。这一榜「.1」没有拉开差距,也没有掉。新版 19 首入榜对旧版 17 首——两版在同一道七绝题上都交了空稿,其余是评分环节的缺样。
整卷不公开,只摘新版评分最高的一首(去己共识 87.1)里的一联:
题面是一处当代街景,前两句交代物事,这一联把眼前的人造物看成天象、再把一街春色与病态并置,反讽藏在写实里,评委给的分高在这里。同题旧版走的是拟人自述、以乡愁收束,稳,但少了这一层翻转。新版另一首七律(85.9)里,视频卡顿、时差、熄屏后映出自己的脸,三处都是只有当代人才写得出、又没有一个新词的句子——这是我们对「用旧体写今事」最想看到的样子。
诗评:从第 3 掉到垫底,掉的是尺度不是眼力
这是四榜里唯一退步的一榜,也是最值得说的一榜。
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。发布版里 Kimi K3 第 1(4.4),Doubao 第 2,Fable 5 第 3(4.96)。Fable 5.1 的平均绝对偏差是 10.48,11 席垫底。
但平均绝对偏差把两件事混在一起:尺度宽严和判断力。一位每题都比共识低 10 分、但排序完全跟得上的评委,偏差会等于那 10 分。所以榜面另出三列——尺度偏移、去偏移偏差、秩相关——把它拆开:
| Fable 5.1顶替后池 | Fable 5发布版池 | Kimi K3榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 10.48#11 | 4.96#3 | 4.71#1 |
| 尺度偏移负=偏严 | −10.32 | −4.30 | −1.72 |
| 去偏移偏差越小越准 | 4.25#2 | 3.71 | 4.58#3 |
| 秩相关 ρ | 0.893 | 0.928 | 0.851 |
| 低于共识打分占比 | 97%191 份 | — | 61% |
GPT-5.6 Sol 作参照:尺度偏移 +7.31、去偏移偏差 3.79(第 1)、低于共识 4%。
拆开之后画面清楚了:新版给分平均比共识低 10 分(55.9 对 66.2),191 份打分里 97% 低于共识——Kimi 是 61%,GPT 是 4%。但去掉这个整体偏移之后,偏差 4.25,全榜第 2(第一 GPT-5.6 Sol 3.79),秩相关 0.893 也在前列。它不是不会看诗,是看什么都不满意。旧版其实已经偏严(−4.30),新版把这个倾向放大了一倍多。
最严的一次,它给一首共识 68.0 的七绝打了 44.25,低了 23.8 分。评语里对这首诗的判断是这样的(作品与题目不公开,只摘评语的论断部分):
前二句纯是陈套铺垫,与题无涉;三句方切入新境却语意含混,结句与题面意象强行拼接,留白有余而所指不明,古今融合未成一体。
这段话作为诗评,每一句都成立——前两句确实是套话,结句确实是硬拼。问题在于别的评委也看见了这些毛病,只是没有扣到 44 分。新版在「警句」「出新」两维给了 1 分(满分 10),「陈滥」2 分——它对「用陈套开头」这件事的容忍度,比整个评委席低一个档。
这和 Anthropic 自己宣传的方向是一致的:发布材料反复讲新版「减少走捷径、更克制」,第三方代码评审平台的测试也报告它评论条数少了三分之一、琐碎意见少了七成。放到诗评上,「克制」变成了「苛刻」——它不再顺着共识打分,而是按自己的标准扣。作为评委这是缺点,作为诗评这未必是。我们的榜面主分仍是原始的平均绝对偏差,名次照掉;三列分解指标摆在那里,读者自己分辨是苛还是差。
成本:这一次,反而更省了
官方定价没变(输入 $10、输出 $50 每百万词元),各家整理稿都提到新版推理更满、输出词元约为前代 1.7 倍、单任务反而更贵。我们判律榜的账单不是这样:
判律答卷账单
| Fable 5.1 | Fable 5 | Kimi K3本期最贵 | DeepSeek V4本期最便宜 | |
|---|---|---|---|---|
| 均价/题美元 | 0.052 | 0.064 | 0.124 | 0.009 |
| 均词元/题 | 1 334 | 1 581 | — | 10 601 |
| 答卷题 | 236 | 213 | 215 | 233 |
| 总费用美元 | 12.18 | 13.63 | 26.73 | 2.14 |
每题均价 $0.064 → $0.052,省 19%;均词元 1 581 → 1 334,少 16%。判律题是短任务——一首诗、一份结构化判定——新版没有在这种题上多想,反而答得更短。「输出翻 1.7 倍」大概是长程智能体任务的事,和这里无关。本期计费的席位里它的单题成本排第 4,与 GPT-5.6 Sol 持平,是 DeepSeek 的 5.6 倍。
结论:读得更准、写得没退、评得更严
把四榜放在一起,Fable 5.1 在格律诗词上的变化可以压成三句话:
读诗更准了。判律错字定位 +13.0,「平仄有误」全场最高,全部答卷有效——这是「.1」里最实的一项进步。
写诗没退。诗才守住榜首,控律的四项「精确犯病」任务明显更听指挥;两榜的总分都在区间里,别把「第 8 → 第 6」读成实力跃迁。
评诗变严了。诗评榜从第 3 掉到垫底,97% 的打分低于共识,平均低 10 分——判断力(去偏移 4.25、ρ 0.893)还在前列,只是尺度整体下移。谁要拿它当自动评委,得先校准这 10 分。
最后说一句口径:以上升降全部按 95% 置信区间判,四榜里只有诗评榜是「明显退步」,其余三榜都是「统计并列」。我们宁可少说一次「提升」。
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。