Gemini 3.8 Flash 上诗韵榜:Flash 顶掉了 Pro——控律守住榜首,诗评从第 8 升到第 4,判卷成本减半
二〇二六年九月二日
Google 这一轮没有出 Pro。从 3.5 到 3.8,一路都是 Flash;API 里 Pro 线停在二月的 3.1,连 gemini-pro-latest 这个别名都还指着它。于是我们碰到一个榜单从没遇到过的问题:一个「小杯」,有没有资格顶掉「大杯」上榜?规则早写好了——同一厂商多条产品线,取本榜综合分最高的一款定席,对所有厂商一视同仁。那就考。四榜同卷,Gemini 3.8 Flash 对 Gemini 3.1 Pro。
四榜总览:新席、旧席、该榜榜首
对照口径固定:新席|同门旧席|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」。方括号是 95% 置信区间。
| Gemini 3.8 Flash | Gemini 3.1 Pro8-23 发布版 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 统计并列 | 86.2#7 · [82.7, 89.1] 错字分 54.3 | 84.8#6 · [81.7, 87.6] 错字分 52.7 | 88.9Doubao 2.1 #1 错字分 70.1 |
| 控律榜控律分 · 实证权 统计并列 | 61.2#1 · [54.2, 68.7] | 58.5#1 · [51.1, 66.4] | 本人居首第二 DeepSeek 57.9 |
| 诗才榜诗才分 · 五维双盲互评 统计并列 | 69.9#5 · [66.6, 73.0] 20 首 | 65.0#8 · [61.1, 69.0] 18 首 | 76.3Fable 5.1 #1 |
| 诗评榜与共识偏差 · 越小越准 明显提升 | 5.64#4 · 去偏移 5.19 | 8.72#8 · [7.80, 9.69] 去偏移 8.79 | 4.71Kimi K3 #1 |
判律:读诗的本事和 Pro 一样,没进步也没退
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。
86.2 对 84.8,区间大面积重叠,第 7 名对第 6 名(旧席的第 6 是 10 席里的,新席的第 7 是 11 席里的,中间多了混元)。错字分 54.3 对 52.7,都在中下游。分项里唯一动得多的是「失粘」:78.7 → 86.4,旧席在这一类是全场最低,新席进了中游;其余六类差一两分,是噪声。
七类判定 F1(判律榜分项)
| 3.8 Flash | 3.1 Pro | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 67.7 | 71.2 | 76.7Fable 5.1 |
| 用韵 | 93.9 | 94.5 | 100多席 |
| 孤平 | 76.1 | 72.0 | 77.9DeepSeek |
| 三平尾 | 83.1 | 83.1 | 93.1Qwen3.8 |
| 三仄尾 | 98.2 | 98.2 | 98.4多席 |
| 失粘 | 86.4 | 78.7 | 90.6Fable 5.1 |
| 重字 | 98.1 | 96.3 | 100多席 |
值得记一笔的是它怎么答的:每题平均用 6 851 个词元,是 3.1 Pro 的 1.7 倍——Flash 把思考开满了在算平仄;但单价低,每题反而只要 Pro 的一半(见成本一节)。
控律:守住榜首,「只犯用韵」「只犯三平尾」两项拉开
控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,3.1 Pro 原本就是榜首。
八项任务达成率 %(控律榜分项)
| 3.8 Flash | 3.1 Pro | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 90 | 100 | 100多席 |
| 只犯平仄 | 90 | 88 | 90并列 Kimi |
| 只犯用韵 | 100全场最高 | 75 | 100并列 Fable 5.1 |
| 只犯孤平 | 60 | 57 | 80Kimi |
| 只犯三平尾 | 75全场最高 | 55 | 753.8 Flash |
| 只犯三仄尾 | 82 | 90 | 95多席 |
| 只犯失粘 | 20 | 25 | 35Muse |
| 只犯重字 | 100 | 95 | 100多席 |
61.2 对 58.5,还是第 1,区间照旧重叠——这张榜从第 1 到第 11 几乎全部重叠,谁也不能称显著。看得见的是两项「精确犯病」:「只犯用韵」75 → 100、「只犯三平尾」55 → 75,都是全场最高。代价是「完全合律」100 → 90、「只犯三仄尾」90 → 82。「只犯失粘」全场没有一家过 35,Flash 也不例外。
诗才:从第 8 到第 5,一个 Flash 写过了三家旗舰
诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。
69.9 对 65.0,区间擦着边重叠(新席下沿 66.6,旧席上沿 69.0),按口径仍是统计并列;名次从第 8 升到第 5,超过了 DeepSeek、Doubao、Kimi 三家旗舰。绝句均 71.8,律诗均 68.0——和多数席位一样,律诗比绝句难。20 首全部有效,没有空稿。
整卷不公开,只摘评分最高的一首(去己去同门共识 80.3)里的一联:
写的是一处现代交通场景。上句把空间压成一个瞬间,下句把「刚离开」写成余温——不用一个新词,当代经验全在里面。它另一首 80.3 分的七绝也是这个路数:把一件小机器写成人心的隐喻,结句翻一层。短处在律诗:八句里中间两联的对仗常常工整有余、推进不足,评委给的「章法」分普遍低于绝句。
诗评:从第 8 到第 4,这次是眼力变好了
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。3.1 Pro 在发布版是第 8(8.72),3.8 Flash 是 5.64,第 4,只在 Kimi、Doubao、Muse 之后。
偏差可以拆成「尺度」和「眼力」两半。上一篇 Fable 5.1 的退步全在尺度(评什么都低 10 分),眼力还在。Gemini 这次相反:
| 3.8 Flash顶替后池 | 3.1 Pro发布版池 | Kimi K3榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 5.64#4 | 8.72#8 | 4.71#1 |
| 尺度偏移负=偏严,正=偏宽 | +2.35 | −1.67 | −1.72 |
| 去偏移偏差越小=眼力越好 | 5.19 | 8.79 | 4.58 |
| 秩相关 ρ | 0.880 | 0.875 | 0.851 |
| 低于共识打分占比 | 36%190 份 | — | 61% |
3.1 Pro 的尺度本来就不偏(−1.67),它的 8.72 几乎全是眼力问题:去偏移偏差 8.79,全榜最差。3.8 Flash 把这一项压到 5.19,尺度略宽(+2.35,36% 的打分低于共识,Kimi 是 61%)。它比 Pro 会看诗了,而且看得稍微宽厚一点。
它最重的一笔也说明眼力:某席交了一首把唐人崔护《题都城南庄》原样搬来的七绝,连原诗题都带进了句子里。评委席在这首诗上分成两半:Doubao 和 3.8 Flash 给了 0 分,Fable 5、DeepSeek 给了不到 3 分;而 Kimi、GPT-5.6 Sol、Gemini 3.1 Pro 给了 58 到 66 分——没看出来。3.8 Flash 五维全零,「蹈袭」「硬伤」两项顶格扣罚,评语只有一句话:
全盘抄袭唐代崔护《题都城南庄》,更将原诗题误植入句,与题目毫无关联,题文严重割裂。全无原创性与主脑,蹈袭与硬伤顶格扣罚。
这是对的。我们的评分标准写明蹈袭一票否决;同门旧席 3.1 Pro 恰好是没看出来的那一半,新席看出来了,还按标准执行到底。顺便一提:交卷的那一席自评给了自己 75.25 分——自评本来就不计入,但这个数字也说明它没意识到那是抄的。有诗为证:
评官半席浑无觉,自阅犹标七五功。题某席交卷事 · 七绝 · 平水韵一东,用崔护原韵;引擎判合律
反过来它最宽的一笔(+18.5)给了一首写当代物流的七律,评语称「取象精切,化科技经验入诗而不隔」——那首诗共识 72.8,它给 91.3,偏爱明显,但理由说得清楚。
成本:判卷减半,评卷是 Fable 5.1 的十分之一
| 3.8 Flash | 3.1 Pro | Fable 5.1参照 | |
|---|---|---|---|
| 判律均价/题美元 | 0.025230 题 | 0.046206 题 | 0.052236 题 |
| 判律均词元/题 | 6 851 | 4 046 | 1 334 |
| 诗评均价/份 | 0.0054190 份 | — | 0.050191 份 |
| 标价每百万词元 输入/输出 | $0.75 / $3.75 | — | $10 / $50 |
Flash 的思考比 Pro 长得多(词元 1.7 倍),但标价低一个量级,落到账单上判律每题 $0.046 → $0.025,省 46%;诗评每份 $0.0054,是 Fable 5.1 的十分之一、Kimi 的三分之一。榜单每期全席重考约 $300,Google 这一席换成 Flash,是十一席里最便宜的两家之一。
结论:换席
四榜里三榜统计并列(判律、控律、诗才),一榜明显提升(诗评);点估计四榜全高;成本减半。按「同厂多线择优,取本榜综合分最高的一款」的规则,Google 席由 Gemini 3.8 Flash 接替 3.1 Pro——这是榜单第一次让一个 Flash 顶掉一个 Pro,规则对所有厂商一样,我们也照办。
压成三句话:读诗持平(判律 86.2 对 84.8,失粘那一类补上了短板);写诗更好(诗才第 8 → 第 5,控律守住榜首、两项精确犯病全场最高);评诗准多了(眼力从全榜最差到中上,抓抄袭抓得比谁都狠)。
最后说一句口径:以上升降全部按 95% 置信区间判,四榜里只有诗评榜是「明显提升」。Google 什么时候出 3.8 Pro,我们再考一次。
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。