‹返回
升级复测
升级复测

Grok 4.7 上诗韵榜:判律明显进步、错字定位全场第一,写诗仍不稳

2026-09-24 · 二〇二六年九月榜

9 月 21 日 xAI 发布 Grok 4.7,当天就上了 OpenRouter。我们照规矩做同门升级复测:四榜同卷,Grok 4.7 对 Grok 4.6。结论先放在这里:判律明显进步,错字定位全场第一;控律、诗才、诗评三榜与 4.6 统计并列,其中诗评的眼力好了一截;成本翻了将近一倍。Grok 4.7 已顶替 4.6 进入 xAI 席位。

#4 ↑5判律榜 综合 87.6
#8 持平控律榜 83.5
#9 ↑1诗才榜 60.4
#9 ↑1诗评榜 偏差 8.17

外界怎么说

xAI 说 Grok 4.7 换了更大的底座,强化学习跑得更长、题更难,偏重要花几个小时的任务,更会检查自己的活,也更能管长上下文。价格不变,每百万词元输入 2 美元、输出 6 美元,上下文 50 万。Artificial Analysis 测下来智能指数 46,比 4.6 高 2 分;GDPval-AA 1695 Elo,高 90;Terminal-Bench 4.0 升 4.5 个百分点;幻觉率从 34% 降到 29%。知识型智能体任务排在 Claude 两款旗舰之后,编码智能体排第四。代价是词元:一个任务平均 8.1 万输出词元,是 4.6 的 2.25 倍,一道题平均要跑 7 分钟。有媒体的标题干脆写「Grok 4.7 终于来了,但大多数基准还是 Claude 的」。

这些评测没有一项碰过中文,更没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉。

四榜总览:新版、同门旧版、该榜榜首

对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。

Grok 4.7Grok 4.6同门旧版该榜榜首
判律榜综合分 · 七类判定 F1
明显进步
87.6#4 · [84.8, 90.0]
错字分 73.4 全场第一
84.3#9 · [81.3, 86.5]
错字分 61.4
88.9Doubao Seed 2.1
控律榜控律分 · 实证权
统计并列
83.5#8 · [78.6, 88.9]85.7#8 · [80.5, 90.5]93.7Qwen3.8 Max
诗才榜诗才分 · 五维双盲互评
统计并列
60.4#9 · [50.7, 68.9]
零出律 60%
52.8#10 · [49.9, 56.3]
零出律 100%
83.3GPT-6 Astra
诗评榜与共识偏差 · 越小越准
统计并列
8.17#9 · [7.50, 8.87]
去偏移 4.13 · ρ 0.899
9.06#10 · [8.24, 9.86]
去偏移 5.35 · ρ 0.784
4.37GPT-6 Astra
口径说明。新版取 2026-09-24 榜面,即 Grok 4.7 顶替 4.6、Claude Opus 5.5 顶替 Fable 5.1 之后的 11 席。旧版一栏不是 9 月 4 日的旧榜面,而是在同一批题目和评委下、把两处换席都退回去重算的结果,这样新旧两栏同一口径,都用升级后的规则引擎计分。同门回避照旧:同一厂商的模型互不判题、互不打分,算共识时也剔除。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变,别家的分也会动零点几,所以两栏里别家的数字会略有出入。判律 236 题、控律 160 首、诗才 10 个命题各写七绝七律、诗评 194 份打分。题目与答卷按榜单纪律不公开。

判律:总分明显进步,错字定位从 61.4 跳到 73.4

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。

综合分 87.6 对 84.3,名次第 9 升到第 4。两版答的是同一批 236 道题,同卷配对重采样的差值是 +3.3,区间 [+1.3, +5.4],不含零,重采样两千次全部胜出,这是本次复测里唯一一项够得上「明显」的进步。错字分 61.4 升到 73.4,是本期 11 席里最高的。

七类判定 F1(判律榜分项)

Grok 4.7Grok 4.6该类最高11 席
平仄有误73.7全场最高57.373.7Grok 4.7
用韵92.396.8100多席
孤平77.970.982.4Opus 5.5
三平尾81.678.593.1Qwen3.8 Max
三仄尾98.4全场最高98.498.4并列
失粘89.688.292.1Opus 5.5
重字100100100多席

涨得最多的是最难的一类「平仄有误」,57.3 升到 73.7,涨 16.4 分,从中下游跳到全场第一。孤平、三平尾、失粘也各涨一截。唯一退步的是「用韵」,96.8 降到 92.3,它偶尔会把合韵的字判成出韵。

控律:统计并列,「会判」不等于「会写」

控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。

八项任务达成率 %(控律榜分项)

Grok 4.7Grok 4.6该项最高11 席
合律8095100多席
只犯平仄100100100多席
只犯用韵9292100Astra/Gemini
只犯孤平7860100Qwen/Kimi
只犯三平尾100全场最高95100并列
只犯三仄尾8085100Qwen/Astra
只犯失粘557080Astra
只犯重字9598100多席

83.5 对 85.7,名次同为第 8。配对差值 −2.2,区间 [−9.3, +4.6],并列。分项有升有降:「只犯孤平」60 升到 78,但「完全合律」95 掉到 80,二十首里有四首自己写出了病;「只犯失粘」70 掉到 55。它判律大涨,写起来却没跟上,「会判不等于会写」在它身上成立。

诗才:点估计高 7.6 分,但一半作品被声律系数拖住

诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。

Grok 4.7 得 60.4,区间 [50.7, 68.9],宽得反常;4.6 是 52.8 [49.9, 56.3]。两者区间相交,按口径只能写并列,点估计高 7.6 分,名次第 10 升到第 9。区间宽的原因很清楚:20 首里只有 60% 零出律,另外 8 首触发声律系数,被折掉的分很重,好坏悬殊;4.6 当期是 20 首全部合律,只是写得平。没被折的那些作品,质量明显高于 4.6。

整卷不公开,只摘它共识分最高的一首七绝(85.6)的后两句:

箱口斜斜垂敝袖,来年雪里覆肩头。Grok 4.7 · 七绝 · 该首共识 85.6

一件旧棉袄收进箱子,袖子还耷拉在箱口外,像舍不得走;下一句一转,来年落雪时它还要披在肩上。衣物有情、人事有续,收束得暖。

诗评:尺度没变,眼力好了一截

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。偏差可以拆成「尺度」和「眼力」两半。

Grok 4.7Grok 4.6GPT-6 Astra榜首
平均绝对偏差与共识,越小越准8.17#99.06#104.37#1
尺度偏移负=偏严,正=偏宽−7.80−8.23−1.85
去偏移偏差越小=眼力越好4.13全场第 35.354.10
秩相关 ρ0.8990.7840.895

Grok 两代都偏严 8 分上下,这一点没变,所以榜面主分只从 9.06 降到 8.17,区间相交,名次第 10 升到第 9。变的是眼力:去偏移偏差从 5.35 降到 4.13,只比榜首 Astra 多 0.03;秩相关从 0.784 升到 0.899,与 Astra 相当。4.6 是全场排序最乱的评委,4.7 进到了前列。xAI 说新版「更会检查自己的活」,在读别人的诗这件事上看得到。

成本:标价没变,账单翻了将近一倍

Grok 4.7Grok 4.6
判律均价/题美元0.0680.036
判律均词元/题14 3346 442
诗评均价/份美元0.0280.021
标价每百万词元 输入/输出$2 / $6$2 / $6

外界说的「想得更久」在我们这里也看得到:判律每题 14 334 词元、0.068 美元,是 4.6 的 1.9 倍;本期判律答卷合计 16.02 美元,在 11 席里排第三贵。另外,OpenRouter 上它的推理词元不受输出上限约束,估算预算要按两倍半留。

结论:读诗扎实了,写诗还不稳,账单翻倍

读诗更准了。判律同卷配对 +3.3,区间不含零;「平仄有误」和错字分双双全场第一。这是这次升级最实的一项进步。

写诗还不稳。控律并列,「完全合律」反而掉了;诗才点估计高 7.6 分,但四成作品出律被折,区间宽到和 4.6 相交。

评诗眼力好了。尺度照旧偏严,排序判断从全场最乱进到前列。

升降全部按 95% 置信区间判:四榜里只有判律是「明显进步」,其余三榜都是「统计并列」。据此,Grok 4.7 顶替 Grok 4.6 进入 xAI 席位。

外界评论来源

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。


查看完整榜单 →