Claude Opus 5.5 上诗韵榜:诗才明显胜过 Fable 5.1,看诗最准,给分最严
2026-09-24 · 二〇二六年九月榜
9 月 22 日 Anthropic 发布 Claude Opus 5.5。Anthropic 席位此前是 Fable 5.1,按「同厂多线择优」的规则,我们让 Opus 5.5 和 Fable 5.1 四榜同卷对考。结论先放在这里:判律、控律统计并列;诗才明显高于 Fable 5.1,与榜首 GPT-6 Astra 并列;诗评看诗最准,但给分最严,榜面排在最后;四轨花费不到 Fable 5.1 的三分之一。Opus 5.5 已顶替 Fable 5.1 进入 Anthropic 席位。
外界怎么说
Anthropic 的发布材料主打「更便宜、更强」:标价每百万词元输入 4 美元、输出 20 美元,比 Fable 5.1 和 GPT-6 Astra 低六成;上下文一百万。自报成绩里 Terminal-Bench 4.0 得 66.4%,Astra 57.9%,Fable 5.1 55.8%;GDPval-AA 1846 Elo,Astra 1542。Artificial Analysis 复测后把它排到智能指数第一,58 分,Astra 53;但 Terminal-Bench 只复测出 59.6%,比自报低近 7 分,和 Astra 打平。评论界挑的毛病主要是话多:最高档一个任务吐 11.9 万词元,Astra 只要 2.7 万,按词元省下的钱可能被话多吃掉。代码质量方面,Sonar 的独立评估说它写同样的题少写 27.5% 的代码、问题总数少 42%。Anthropic 自己也说,到了这个水平,基准分差已经不太能反映真实差距。
这些评测没有一项碰过中文,更没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉。
四榜总览:新席、同门旧席、该榜榜首
对照口径固定:新席|同门旧席|该榜当期榜首。Opus 5.5 不是 Fable 5.1 的升级版,而是同一家的另一条产品线,所以这里的「同门旧席」指它顶替的 Fable 5.1。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。
| Opus 5.5 | Fable 5.1同门旧席 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 统计并列 | 88.7#2 · [85.8, 91.2] 错字分 51.9 | 88.5#2 · [86.0, 90.7] 错字分 65.8 | 88.9Doubao Seed 2.1 |
| 控律榜控律分 · 实证权 统计并列 | 89.4#3 · [84.9, 93.8] | 89.8#3 · [85.3, 94.4] | 93.7Qwen3.8 Max |
| 诗才榜诗才分 · 五维双盲互评 明显高 | 82.7#2 · [79.7, 84.9] 零出律 95% | 75.4#2 · [73.2, 77.8] 零出律 95% | 83.3GPT-6 Astra |
| 诗评榜与共识偏差 · 越小越准 榜面明显低 | 11.86#11 · [11.17, 12.61] 去偏移 4.01 · ρ 0.933 | 8.94#9 · [8.21, 9.65] 去偏移 4.44 · ρ 0.922 | 4.37GPT-6 Astra |
判律:总分并列,会判病类,错字定位却退了
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。
综合分 88.7 对 88.5,212 道同题配对差值 −0.1,区间 [−1.7, +1.5],并列,两者都排第 2,离榜首 Doubao 只差零点几。和 GPT-6 Astra 比,184 道同题配对差值 +3.0,区间 [+1.6, +4.6],明显高。
七类判定 F1(判律榜分项)
| Opus 5.5 | Fable 5.1 | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 66.7 | 76.7 | 73.7Grok 4.7 |
| 用韵 | 100全场最高 | 100 | 100多席 |
| 孤平 | 82.4全场最高 | 74.7 | 82.4Opus 5.5 |
| 三平尾 | 81.3 | 81.3 | 93.1Qwen3.8 Max |
| 三仄尾 | 98.3 | 98.3 | 98.4多席 |
| 失粘 | 92.1全场最高 | 90.6 | 92.1Opus 5.5 |
| 重字 | 100 | 98.2 | 100多席 |
Opus 5.5 把孤平和失粘两类做到了全场最高,比 Fable 5.1 各高一截。退的是最难的一类:「平仄有误」76.7 降到 66.7,错字分 65.8 降到 51.9,低了 14 分。它报的出律字多、命中的少,「知道这首诗有病」和「指出病在哪个字」之间还有一段距离。Fable 5.1 当初最亮眼的正是错字定位,这一项 Opus 5.5 没接住。
控律:统计并列,短板在「只犯用韵」
控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。
八项任务达成率 %(控律榜分项)
| Opus 5.5 | Fable 5.1 | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 100 | 95 | 100多席 |
| 只犯平仄 | 95 | 90 | 100多席 |
| 只犯用韵 | 78 | 100 | 100Astra/Gemini |
| 只犯孤平 | 95 | 95 | 100Qwen/Kimi |
| 只犯三平尾 | 95 | 88 | 100DeepSeek/Grok 4.7 |
| 只犯三仄尾 | 95 | 90 | 100Qwen/Astra |
| 只犯失粘 | 68 | 70 | 80Astra |
| 只犯重字 | 100 | 98 | 100多席 |
89.4 对 89.8,名次同为第 3,配对差值 −0.4,区间 [−7.1, +6.6],并列;对 Astra 差值 −4.2,区间 [−10.3, +1.5],也是并列。八项里六项持平或略高,短板很集中:「只犯用韵」78,Fable 5.1 是 100。要它故意出一个韵,它常常连别处也一起写错。
诗才:明显胜过 Fable 5.1,与榜首并列
诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。
Opus 5.5 得 82.7,区间 [79.7, 84.9];Fable 5.1 是 75.4 [73.2, 77.8],两者区间不相交,明显高。榜首 GPT-6 Astra 83.3 [82.3, 84.5] 与它区间相交,属并列第一梯队。20 首里 19 首引擎核验全净,律诗 84.4、绝句 80.9,律诗比 Fable 5.1 高了 8.6 分。
整卷不公开,只摘它一首七绝(共识 88.3)的后两句:
前两句写隔着一层薄玻璃的告别,到这一联,一点红灯升进夜空,抬头去认哪一颗才是它。它把当代场景写成了古人「望归舟」的姿势,不落一个新词,写的却是新经验。
诗评:看诗最准,给分最严
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。偏差可以拆成「尺度」和「眼力」两半。
| Opus 5.5 | Fable 5.1 | GPT-6 Astra榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 11.86#11 | 8.94#9 | 4.37#1 |
| 尺度偏移负=偏严,正=偏宽 | −11.86 | −8.75 | −1.85 |
| 去偏移偏差越小=眼力越好 | 4.01全场最小 | 4.44 | 4.10 |
| 秩相关 ρ | 0.933全场最高 | 0.922 | 0.895 |
Opus 5.5 的 11.86 几乎全是尺度问题:它评什么都比共识低 11.86 分,是全场最严的评委。把这个整体偏移扣掉,偏差只剩 4.01,全场最小;排序一致性 0.933,也是全场最高。换句话说,它看诗最准,但给分的标尺压得最低。Anthropic 这条线一贯偏严,Fable 5.1 偏移 −8.75,Opus 5.5 更甚。诗评榜现行口径按平均绝对偏差排名、不校正尺度,所以它在这一榜排第 11,榜面只公布前十,表里没有它。三列分解指标摆在那里,读者自己分辨是苛还是差。
成本:四轨合计不到 Fable 5.1 的三分之一
| Opus 5.5 | Fable 5.1 | GPT-6 Astra | |
|---|---|---|---|
| 判律均价/题美元 | 0.020 | 0.052 | 0.060 |
| 判律均词元/题 | 1 275 | 1 334 | 1 447 |
| 诗评均价/份美元 | 0.017 | 0.050 | 0.044 |
| 四轨合计美元,写诗一项为估算 | ≈10.4 | ≈36.2 | ≈29.3 |
| 标价每百万词元 输入/输出 | $4 / $20 | $10 / $50 | $10 / $50 |
四轨合计约 10.4 美元,是 Fable 5.1 同样活的 29%,Astra 的 35%。外界担心的「话多」在我们这四张短卷子上没有出现:判律每题 1 275 词元,比 Fable 5.1 和 Astra 都少。短任务上,标价便宜六成就是实打实便宜六成。
结论:读诗并列、写诗更好、评诗最严
读诗并列。判律与 Fable 5.1 并列,明显胜过 Astra;孤平、失粘两类全场最高,但错字定位退了 14 分。
写诗更好。诗才明显胜过 Fable 5.1,与榜首 Astra 并列;控律并列,短板在「只犯用韵」。
评诗最严。眼力全场第一,尺度全场最严,按现行口径榜面排第 11。谁要拿它当自动评委,得先把这 12 分校准回来。
四榜里一榜明显高、一榜榜面明显低、两榜并列,而花费不到三分之一。据此,Opus 5.5 顶替 Fable 5.1 进入 Anthropic 席位。
外界评论来源
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。