‹返回
换席复测
换席复测

Claude Opus 5.5 上诗韵榜:诗才明显胜过 Fable 5.1,看诗最准,给分最严

2026-09-24 · 二〇二六年九月榜

9 月 22 日 Anthropic 发布 Claude Opus 5.5。Anthropic 席位此前是 Fable 5.1,按「同厂多线择优」的规则,我们让 Opus 5.5 和 Fable 5.1 四榜同卷对考。结论先放在这里:判律、控律统计并列;诗才明显高于 Fable 5.1,与榜首 GPT-6 Astra 并列;诗评看诗最准,但给分最严,榜面排在最后;四轨花费不到 Fable 5.1 的三分之一。Opus 5.5 已顶替 Fable 5.1 进入 Anthropic 席位。

#2 持平判律榜 综合 88.7
#3 持平控律榜 89.4
#2 明显高诗才榜 82.7
#11 ↓2诗评榜 偏差 11.86

外界怎么说

Anthropic 的发布材料主打「更便宜、更强」:标价每百万词元输入 4 美元、输出 20 美元,比 Fable 5.1 和 GPT-6 Astra 低六成;上下文一百万。自报成绩里 Terminal-Bench 4.0 得 66.4%,Astra 57.9%,Fable 5.1 55.8%;GDPval-AA 1846 Elo,Astra 1542。Artificial Analysis 复测后把它排到智能指数第一,58 分,Astra 53;但 Terminal-Bench 只复测出 59.6%,比自报低近 7 分,和 Astra 打平。评论界挑的毛病主要是话多:最高档一个任务吐 11.9 万词元,Astra 只要 2.7 万,按词元省下的钱可能被话多吃掉。代码质量方面,Sonar 的独立评估说它写同样的题少写 27.5% 的代码、问题总数少 42%。Anthropic 自己也说,到了这个水平,基准分差已经不太能反映真实差距。

这些评测没有一项碰过中文,更没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉。

四榜总览:新席、同门旧席、该榜榜首

对照口径固定:新席|同门旧席|该榜当期榜首。Opus 5.5 不是 Fable 5.1 的升级版,而是同一家的另一条产品线,所以这里的「同门旧席」指它顶替的 Fable 5.1。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。

Opus 5.5Fable 5.1同门旧席该榜榜首
判律榜综合分 · 七类判定 F1
统计并列
88.7#2 · [85.8, 91.2]
错字分 51.9
88.5#2 · [86.0, 90.7]
错字分 65.8
88.9Doubao Seed 2.1
控律榜控律分 · 实证权
统计并列
89.4#3 · [84.9, 93.8]89.8#3 · [85.3, 94.4]93.7Qwen3.8 Max
诗才榜诗才分 · 五维双盲互评
明显高
82.7#2 · [79.7, 84.9]
零出律 95%
75.4#2 · [73.2, 77.8]
零出律 95%
83.3GPT-6 Astra
诗评榜与共识偏差 · 越小越准
榜面明显低
11.86#11 · [11.17, 12.61]
去偏移 4.01 · ρ 0.933
8.94#9 · [8.21, 9.65]
去偏移 4.44 · ρ 0.922
4.37GPT-6 Astra
口径说明。新席取 2026-09-24 榜面,即 Opus 5.5 顶替 Fable 5.1、Grok 4.7 顶替 Grok 4.6 之后的 11 席。旧席一栏不是 9 月 4 日的旧榜面,而是在同一批题目和评委下、把两处换席都退回去重算的结果,这样两栏同一口径,都用升级后的规则引擎计分。同门回避照旧:Opus 5.5 与 Fable 5.1 同属 Anthropic,互不判题、互不打分,算共识时也剔除。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变,别家的分也会动零点几。榜面只公布前十,诗评榜的 Opus 5.5 排第 11,不在公布的表里。判律 236 题、控律 160 首、诗才 10 个命题各写七绝七律、诗评 194 份打分。题目与答卷按榜单纪律不公开。

判律:总分并列,会判病类,错字定位却退了

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。

综合分 88.7 对 88.5,212 道同题配对差值 −0.1,区间 [−1.7, +1.5],并列,两者都排第 2,离榜首 Doubao 只差零点几。和 GPT-6 Astra 比,184 道同题配对差值 +3.0,区间 [+1.6, +4.6],明显高。

七类判定 F1(判律榜分项)

Opus 5.5Fable 5.1该类最高11 席
平仄有误66.776.773.7Grok 4.7
用韵100全场最高100100多席
孤平82.4全场最高74.782.4Opus 5.5
三平尾81.381.393.1Qwen3.8 Max
三仄尾98.398.398.4多席
失粘92.1全场最高90.692.1Opus 5.5
重字10098.2100多席

Opus 5.5 把孤平和失粘两类做到了全场最高,比 Fable 5.1 各高一截。退的是最难的一类:「平仄有误」76.7 降到 66.7,错字分 65.8 降到 51.9,低了 14 分。它报的出律字多、命中的少,「知道这首诗有病」和「指出病在哪个字」之间还有一段距离。Fable 5.1 当初最亮眼的正是错字定位,这一项 Opus 5.5 没接住。

控律:统计并列,短板在「只犯用韵」

控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。

八项任务达成率 %(控律榜分项)

Opus 5.5Fable 5.1该项最高11 席
合律10095100多席
只犯平仄9590100多席
只犯用韵78100100Astra/Gemini
只犯孤平9595100Qwen/Kimi
只犯三平尾9588100DeepSeek/Grok 4.7
只犯三仄尾9590100Qwen/Astra
只犯失粘687080Astra
只犯重字10098100多席

89.4 对 89.8,名次同为第 3,配对差值 −0.4,区间 [−7.1, +6.6],并列;对 Astra 差值 −4.2,区间 [−10.3, +1.5],也是并列。八项里六项持平或略高,短板很集中:「只犯用韵」78,Fable 5.1 是 100。要它故意出一个韵,它常常连别处也一起写错。

诗才:明显胜过 Fable 5.1,与榜首并列

诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。

Opus 5.5 得 82.7,区间 [79.7, 84.9];Fable 5.1 是 75.4 [73.2, 77.8],两者区间不相交,明显高。榜首 GPT-6 Astra 83.3 [82.3, 84.5] 与它区间相交,属并列第一梯队。20 首里 19 首引擎核验全净,律诗 84.4、绝句 80.9,律诗比 Fable 5.1 高了 8.6 分。

整卷不公开,只摘它一首七绝(共识 88.3)的后两句:

一灯红上青冥去,独向繁星认是谁。Claude Opus 5.5 · 七绝 · 该首共识 88.3

前两句写隔着一层薄玻璃的告别,到这一联,一点红灯升进夜空,抬头去认哪一颗才是它。它把当代场景写成了古人「望归舟」的姿势,不落一个新词,写的却是新经验。

诗评:看诗最准,给分最严

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。偏差可以拆成「尺度」和「眼力」两半。

Opus 5.5Fable 5.1GPT-6 Astra榜首
平均绝对偏差与共识,越小越准11.86#118.94#94.37#1
尺度偏移负=偏严,正=偏宽−11.86−8.75−1.85
去偏移偏差越小=眼力越好4.01全场最小4.444.10
秩相关 ρ0.933全场最高0.9220.895

Opus 5.5 的 11.86 几乎全是尺度问题:它评什么都比共识低 11.86 分,是全场最严的评委。把这个整体偏移扣掉,偏差只剩 4.01,全场最小;排序一致性 0.933,也是全场最高。换句话说,它看诗最准,但给分的标尺压得最低。Anthropic 这条线一贯偏严,Fable 5.1 偏移 −8.75,Opus 5.5 更甚。诗评榜现行口径按平均绝对偏差排名、不校正尺度,所以它在这一榜排第 11,榜面只公布前十,表里没有它。三列分解指标摆在那里,读者自己分辨是苛还是差。

成本:四轨合计不到 Fable 5.1 的三分之一

Opus 5.5Fable 5.1GPT-6 Astra
判律均价/题美元0.0200.0520.060
判律均词元/题1 2751 3341 447
诗评均价/份美元0.0170.0500.044
四轨合计美元,写诗一项为估算≈10.4≈36.2≈29.3
标价每百万词元 输入/输出$4 / $20$10 / $50$10 / $50

四轨合计约 10.4 美元,是 Fable 5.1 同样活的 29%,Astra 的 35%。外界担心的「话多」在我们这四张短卷子上没有出现:判律每题 1 275 词元,比 Fable 5.1 和 Astra 都少。短任务上,标价便宜六成就是实打实便宜六成。

结论:读诗并列、写诗更好、评诗最严

读诗并列。判律与 Fable 5.1 并列,明显胜过 Astra;孤平、失粘两类全场最高,但错字定位退了 14 分。

写诗更好。诗才明显胜过 Fable 5.1,与榜首 Astra 并列;控律并列,短板在「只犯用韵」。

评诗最严。眼力全场第一,尺度全场最严,按现行口径榜面排第 11。谁要拿它当自动评委,得先把这 12 分校准回来。

四榜里一榜明显高、一榜榜面明显低、两榜并列,而花费不到三分之一。据此,Opus 5.5 顶替 Fable 5.1 进入 Anthropic 席位。

外界评论来源

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。


查看完整榜单 →