Grok 4.7 上诗韵榜:判律明显进步、错字定位全场第一,写诗仍不稳
2026-09-24 · 二〇二六年九月榜
9 月 21 日 xAI 发布 Grok 4.7,当天就上了 OpenRouter。我们照规矩做同门升级复测:四榜同卷,Grok 4.7 对 Grok 4.6。结论先放在这里:判律明显进步,错字定位全场第一;控律、诗才、诗评三榜与 4.6 统计并列,其中诗评的眼力好了一截;成本翻了将近一倍。Grok 4.7 已顶替 4.6 进入 xAI 席位。
外界怎么说
xAI 说 Grok 4.7 换了更大的底座,强化学习跑得更长、题更难,偏重要花几个小时的任务,更会检查自己的活,也更能管长上下文。价格不变,每百万词元输入 2 美元、输出 6 美元,上下文 50 万。Artificial Analysis 测下来智能指数 46,比 4.6 高 2 分;GDPval-AA 1695 Elo,高 90;Terminal-Bench 4.0 升 4.5 个百分点;幻觉率从 34% 降到 29%。知识型智能体任务排在 Claude 两款旗舰之后,编码智能体排第四。代价是词元:一个任务平均 8.1 万输出词元,是 4.6 的 2.25 倍,一道题平均要跑 7 分钟。有媒体的标题干脆写「Grok 4.7 终于来了,但大多数基准还是 Claude 的」。
这些评测没有一项碰过中文,更没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉。
四榜总览:新版、同门旧版、该榜榜首
对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。
| Grok 4.7 | Grok 4.6同门旧版 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 明显进步 | 87.6#4 · [84.8, 90.0] 错字分 73.4 全场第一 | 84.3#9 · [81.3, 86.5] 错字分 61.4 | 88.9Doubao Seed 2.1 |
| 控律榜控律分 · 实证权 统计并列 | 83.5#8 · [78.6, 88.9] | 85.7#8 · [80.5, 90.5] | 93.7Qwen3.8 Max |
| 诗才榜诗才分 · 五维双盲互评 统计并列 | 60.4#9 · [50.7, 68.9] 零出律 60% | 52.8#10 · [49.9, 56.3] 零出律 100% | 83.3GPT-6 Astra |
| 诗评榜与共识偏差 · 越小越准 统计并列 | 8.17#9 · [7.50, 8.87] 去偏移 4.13 · ρ 0.899 | 9.06#10 · [8.24, 9.86] 去偏移 5.35 · ρ 0.784 | 4.37GPT-6 Astra |
判律:总分明显进步,错字定位从 61.4 跳到 73.4
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。
综合分 87.6 对 84.3,名次第 9 升到第 4。两版答的是同一批 236 道题,同卷配对重采样的差值是 +3.3,区间 [+1.3, +5.4],不含零,重采样两千次全部胜出,这是本次复测里唯一一项够得上「明显」的进步。错字分 61.4 升到 73.4,是本期 11 席里最高的。
七类判定 F1(判律榜分项)
| Grok 4.7 | Grok 4.6 | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 73.7全场最高 | 57.3 | 73.7Grok 4.7 |
| 用韵 | 92.3 | 96.8 | 100多席 |
| 孤平 | 77.9 | 70.9 | 82.4Opus 5.5 |
| 三平尾 | 81.6 | 78.5 | 93.1Qwen3.8 Max |
| 三仄尾 | 98.4全场最高 | 98.4 | 98.4并列 |
| 失粘 | 89.6 | 88.2 | 92.1Opus 5.5 |
| 重字 | 100 | 100 | 100多席 |
涨得最多的是最难的一类「平仄有误」,57.3 升到 73.7,涨 16.4 分,从中下游跳到全场第一。孤平、三平尾、失粘也各涨一截。唯一退步的是「用韵」,96.8 降到 92.3,它偶尔会把合韵的字判成出韵。
控律:统计并列,「会判」不等于「会写」
控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。
八项任务达成率 %(控律榜分项)
| Grok 4.7 | Grok 4.6 | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 80 | 95 | 100多席 |
| 只犯平仄 | 100 | 100 | 100多席 |
| 只犯用韵 | 92 | 92 | 100Astra/Gemini |
| 只犯孤平 | 78 | 60 | 100Qwen/Kimi |
| 只犯三平尾 | 100全场最高 | 95 | 100并列 |
| 只犯三仄尾 | 80 | 85 | 100Qwen/Astra |
| 只犯失粘 | 55 | 70 | 80Astra |
| 只犯重字 | 95 | 98 | 100多席 |
83.5 对 85.7,名次同为第 8。配对差值 −2.2,区间 [−9.3, +4.6],并列。分项有升有降:「只犯孤平」60 升到 78,但「完全合律」95 掉到 80,二十首里有四首自己写出了病;「只犯失粘」70 掉到 55。它判律大涨,写起来却没跟上,「会判不等于会写」在它身上成立。
诗才:点估计高 7.6 分,但一半作品被声律系数拖住
诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。
Grok 4.7 得 60.4,区间 [50.7, 68.9],宽得反常;4.6 是 52.8 [49.9, 56.3]。两者区间相交,按口径只能写并列,点估计高 7.6 分,名次第 10 升到第 9。区间宽的原因很清楚:20 首里只有 60% 零出律,另外 8 首触发声律系数,被折掉的分很重,好坏悬殊;4.6 当期是 20 首全部合律,只是写得平。没被折的那些作品,质量明显高于 4.6。
整卷不公开,只摘它共识分最高的一首七绝(85.6)的后两句:
一件旧棉袄收进箱子,袖子还耷拉在箱口外,像舍不得走;下一句一转,来年落雪时它还要披在肩上。衣物有情、人事有续,收束得暖。
诗评:尺度没变,眼力好了一截
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。偏差可以拆成「尺度」和「眼力」两半。
| Grok 4.7 | Grok 4.6 | GPT-6 Astra榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 8.17#9 | 9.06#10 | 4.37#1 |
| 尺度偏移负=偏严,正=偏宽 | −7.80 | −8.23 | −1.85 |
| 去偏移偏差越小=眼力越好 | 4.13全场第 3 | 5.35 | 4.10 |
| 秩相关 ρ | 0.899 | 0.784 | 0.895 |
Grok 两代都偏严 8 分上下,这一点没变,所以榜面主分只从 9.06 降到 8.17,区间相交,名次第 10 升到第 9。变的是眼力:去偏移偏差从 5.35 降到 4.13,只比榜首 Astra 多 0.03;秩相关从 0.784 升到 0.899,与 Astra 相当。4.6 是全场排序最乱的评委,4.7 进到了前列。xAI 说新版「更会检查自己的活」,在读别人的诗这件事上看得到。
成本:标价没变,账单翻了将近一倍
| Grok 4.7 | Grok 4.6 | |
|---|---|---|
| 判律均价/题美元 | 0.068 | 0.036 |
| 判律均词元/题 | 14 334 | 6 442 |
| 诗评均价/份美元 | 0.028 | 0.021 |
| 标价每百万词元 输入/输出 | $2 / $6 | $2 / $6 |
外界说的「想得更久」在我们这里也看得到:判律每题 14 334 词元、0.068 美元,是 4.6 的 1.9 倍;本期判律答卷合计 16.02 美元,在 11 席里排第三贵。另外,OpenRouter 上它的推理词元不受输出上限约束,估算预算要按两倍半留。
结论:读诗扎实了,写诗还不稳,账单翻倍
读诗更准了。判律同卷配对 +3.3,区间不含零;「平仄有误」和错字分双双全场第一。这是这次升级最实的一项进步。
写诗还不稳。控律并列,「完全合律」反而掉了;诗才点估计高 7.6 分,但四成作品出律被折,区间宽到和 4.6 相交。
评诗眼力好了。尺度照旧偏严,排序判断从全场最乱进到前列。
升降全部按 95% 置信区间判:四榜里只有判律是「明显进步」,其余三榜都是「统计并列」。据此,Grok 4.7 顶替 Grok 4.6 进入 xAI 席位。
外界评论来源
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。