‹返回
升级复测
升级复测

Fable 5.1 上诗韵榜:错字定位大涨、诗才守住榜首,当评委却变成了「严师」

二〇二六年九月二日

9 月 1 日 Anthropic 发布 Claude Fable 5.1。官方材料和随后的各家整理稿谈的是编程、科研、缓存价格和企业部署;我们关心的问题窄得多:一个「.1」升级,在格律诗词这件事上到底动了什么?诗韵榜四榜同卷复测一遍,答案比预想的有意思——三榜守住或略进,一榜从第 3 掉到垫底,而掉的原因恰恰是它「变严了」。

#2 ↑2判律榜 综合 88.5
#6 ↑2控律榜 55.0
#1 持平诗才榜 76.3
#11 ↓8诗评榜 偏差 10.48

四榜总览:新版、同门旧版、该榜榜首

对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,点估计涨零点几分不算数。方括号是 95% 置信区间。

Fable 5.1Fable 58-23 发布版该榜榜首
判律榜综合分 · 七类判定 F1
统计并列
88.5#2 · [85.8, 90.8]
错字分 65.8
87.3#4 · [84.2, 90.0]
错字分 52.8
88.9Doubao 2.1 #1
错字分 70.1
控律榜控律分 · 实证权
统计并列
55.0#6 · [47.9, 62.7]51.1#8 · [42.7, 59.0]58.6Gemini 3.1 Pro #1
诗才榜诗才分 · 五维双盲互评
统计并列
76.3#1 · [73.9, 78.8]
19 首
77.5#1 · [74.6, 80.2]
17 首
本人居首第二 GLM-5.3 74.6
诗评榜与共识偏差 · 越小越准
明显退步
10.48#11 垫底
尺度偏移 −10.32
4.96#3 · [4.39, 5.52]4.71Kimi K3 #1
口径说明。旧版取 2026-08-23 发布版榜面(10 席)。新版是让 Fable 5.1 顶替 Fable 5 那一席之后的重算(11 席:发布版 10 席去 Fable 5 与 Gemini 3.1 Pro,加 Fable 5.1、Gemini 3.8 Flash 与 8-28 入池的腾讯混元 hy4)。同门回避自本期起生效:同一厂商的两款模型互不判题、互不打分,算共识时也剔除。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变,别家的分也会动零点几,所以「榜首」取重算池的榜首,正式发榜以届时榜面为准。判律 236 题(同门回避后计 213)、控律 160 首、诗才 20 题×两体裁、诗评 191 份打分。题目与答卷按榜单纪律不公开。

判律:总分并列,错字定位从 52.8 跳到 65.8

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量「平仄有误」这一类里能不能把错字指到位。

综合分 88.5 对 87.3,区间大面积重叠,名次第 4 → 第 2 是挤过了 Qwen 的 88.2 和 DeepSeek 的 87.4,离榜首 Doubao 的 88.9 只差 0.4。真正动了的是错字分:52.8 → 65.8,涨 13.0。这一项旧版在发布版 10 席里排倒数第二,新版进了前列,仍落后榜首 Doubao 的 70.1。

七类判定 F1(判律榜分项)

Fable 5.1Fable 5该类最高11 席
平仄有误76.7全场最高72.176.7Fable 5.1
用韵10093.9100并列
孤平74.774.777.9DeepSeek
三平尾81.381.393.1Qwen3.8
三仄尾98.398.398.4多席
失粘90.6全场最高90.690.6Fable 5.1
重字98.2100100多席

分项看,「平仄有误」76.7 是全场最高,「用韵」判到 100,「失粘」90.6 也是全场最高;孤平、三平尾、三仄尾与旧版一分不差,重字退两分,在噪声里。换句话说,新版把最难的一类(逐字辨平仄)往前推了一截,别的类持平。顺带一提,新版 236 题全部有效作答,同门回避后计 213 题;旧版当期有效卷 213。

控律:写命题诗守规矩,名次升两位,但全榜本就挤在一起

控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,榜首也只有 58.6 分。

八项任务达成率 %(控律榜分项)

Fable 5.1Fable 5该项最高11 席
合律95100100多席
只犯平仄758590Kimi
只犯用韵100全场最高80100Fable 5.1
只犯孤平554080Kimi
只犯三平尾452560Grok/GPT
只犯三仄尾805595多席
只犯失粘203035Muse
只犯重字98100100多席

55.0 对 51.1,名次第 8 → 第 6,与 Qwen3.8-Max 同分。但要老实说:这张榜从第 1 到第 11 的置信区间几乎全部重叠,任何两席之间都不能称「显著」。能看的是分项:「只犯三仄尾」55 → 80、「只犯三平尾」25 → 45、「只犯孤平」40 → 55、「只犯用韵」80 → 100——这四项都是「故意犯一个指定的病、别的地方不能错」,要求对格律有精确的控制,新版明显更听指挥。代价是「完全合律」100 → 95、「只犯平仄」85 → 75。

「只犯失粘」全场最高 35,新版 20,旧版 30。失粘是通盘推演类的病:要写出一首失粘、又不带任何其他毛病的七绝,等于先把整首正格写对再精确挪一联。这一项目前没有一家过关。

诗才:守住榜首,点估计还低了一分

诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人的分。题目是当期机密,这里不列。

新版 76.3,旧版发布时 77.5,区间重叠,仍是榜首,第二 GLM-5.3 74.6、第三 GPT-5.6 Sol 74.4 都在两三分之内。点估计低了一分,但这一分不能全算在作品头上:评委席换了——新版自己是个严评委(下一节),它给别人打低分的同时,别人的共识也被它拉低;旧版发布时评委席里没有它。这一榜「.1」没有拉开差距,也没有掉。新版 19 首入榜对旧版 17 首——两版在同一道七绝题上都交了空稿,其余是评分环节的缺样。

整卷不公开,只摘新版评分最高的一首(去己共识 87.1)里的一联:

错认长丝为雨脚,一街新绿病中开。Fable 5.1 · 七绝 · 该首去己共识 87.1

题面是一处当代街景,前两句交代物事,这一联把眼前的人造物看成天象、再把一街春色与病态并置,反讽藏在写实里,评委给的分高在这里。同题旧版走的是拟人自述、以乡愁收束,稳,但少了这一层翻转。新版另一首七律(85.9)里,视频卡顿、时差、熄屏后映出自己的脸,三处都是只有当代人才写得出、又没有一个新词的句子——这是我们对「用旧体写今事」最想看到的样子。

诗评:从第 3 掉到垫底,掉的是尺度不是眼力

这是四榜里唯一退步的一榜,也是最值得说的一榜。

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。发布版里 Kimi K3 第 1(4.4),Doubao 第 2,Fable 5 第 3(4.96)。Fable 5.1 的平均绝对偏差是 10.48,11 席垫底。

但平均绝对偏差把两件事混在一起:尺度宽严和判断力。一位每题都比共识低 10 分、但排序完全跟得上的评委,偏差会等于那 10 分。所以榜面另出三列——尺度偏移、去偏移偏差、秩相关——把它拆开:

Fable 5.1顶替后池Fable 5发布版池Kimi K3榜首
平均绝对偏差与共识,越小越准10.48#114.96#34.71#1
尺度偏移负=偏严−10.32−4.30−1.72
去偏移偏差越小越准4.25#23.714.58#3
秩相关 ρ0.8930.9280.851
低于共识打分占比97%191 份—61%

GPT-5.6 Sol 作参照:尺度偏移 +7.31、去偏移偏差 3.79(第 1)、低于共识 4%。

拆开之后画面清楚了:新版给分平均比共识低 10 分(55.9 对 66.2),191 份打分里 97% 低于共识——Kimi 是 61%,GPT 是 4%。但去掉这个整体偏移之后,偏差 4.25,全榜第 2(第一 GPT-5.6 Sol 3.79),秩相关 0.893 也在前列。它不是不会看诗,是看什么都不满意。旧版其实已经偏严(−4.30),新版把这个倾向放大了一倍多。

最严的一次,它给一首共识 68.0 的七绝打了 44.25,低了 23.8 分。评语里对这首诗的判断是这样的(作品与题目不公开,只摘评语的论断部分):

前二句纯是陈套铺垫,与题无涉;三句方切入新境却语意含混,结句与题面意象强行拼接,留白有余而所指不明,古今融合未成一体。

这段话作为诗评,每一句都成立——前两句确实是套话,结句确实是硬拼。问题在于别的评委也看见了这些毛病,只是没有扣到 44 分。新版在「警句」「出新」两维给了 1 分(满分 10),「陈滥」2 分——它对「用陈套开头」这件事的容忍度,比整个评委席低一个档。

这和 Anthropic 自己宣传的方向是一致的:发布材料反复讲新版「减少走捷径、更克制」,第三方代码评审平台的测试也报告它评论条数少了三分之一、琐碎意见少了七成。放到诗评上,「克制」变成了「苛刻」——它不再顺着共识打分,而是按自己的标准扣。作为评委这是缺点,作为诗评这未必是。我们的榜面主分仍是原始的平均绝对偏差,名次照掉;三列分解指标摆在那里,读者自己分辨是苛还是差。

成本:这一次,反而更省了

官方定价没变(输入 $10、输出 $50 每百万词元),各家整理稿都提到新版推理更满、输出词元约为前代 1.7 倍、单任务反而更贵。我们判律榜的账单不是这样:

判律答卷账单

Fable 5.1Fable 5Kimi K3本期最贵DeepSeek V4本期最便宜
均价/题美元0.0520.0640.1240.009
均词元/题1 3341 581—10 601
答卷题236213215233
总费用美元12.1813.6326.732.14

每题均价 $0.064 → $0.052,省 19%;均词元 1 581 → 1 334,少 16%。判律题是短任务——一首诗、一份结构化判定——新版没有在这种题上多想,反而答得更短。「输出翻 1.7 倍」大概是长程智能体任务的事,和这里无关。本期计费的席位里它的单题成本排第 4,与 GPT-5.6 Sol 持平,是 DeepSeek 的 5.6 倍。

结论:读得更准、写得没退、评得更严

把四榜放在一起,Fable 5.1 在格律诗词上的变化可以压成三句话:

读诗更准了。判律错字定位 +13.0,「平仄有误」全场最高,全部答卷有效——这是「.1」里最实的一项进步。

写诗没退。诗才守住榜首,控律的四项「精确犯病」任务明显更听指挥;两榜的总分都在区间里,别把「第 8 → 第 6」读成实力跃迁。

评诗变严了。诗评榜从第 3 掉到垫底,97% 的打分低于共识,平均低 10 分——判断力(去偏移 4.25、ρ 0.893)还在前列,只是尺度整体下移。谁要拿它当自动评委,得先校准这 10 分。

最后说一句口径:以上升降全部按 95% 置信区间判,四榜里只有诗评榜是「明显退步」,其余三榜都是「统计并列」。我们宁可少说一次「提升」。

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。


查看完整榜单 →