‹返回
择优考
择优考

Gemini 3.8 Flash 上诗韵榜:Flash 顶掉了 Pro——控律守住榜首,诗评从第 8 升到第 4,判卷成本减半

二〇二六年九月二日

Google 这一轮没有出 Pro。从 3.5 到 3.8,一路都是 Flash;API 里 Pro 线停在二月的 3.1,连 gemini-pro-latest 这个别名都还指着它。于是我们碰到一个榜单从没遇到过的问题:一个「小杯」,有没有资格顶掉「大杯」上榜?规则早写好了——同一厂商多条产品线,取本榜综合分最高的一款定席,对所有厂商一视同仁。那就考。四榜同卷,Gemini 3.8 Flash 对 Gemini 3.1 Pro。

#7 并列判律榜 综合 86.2
#1 守住控律榜 61.2
#5 ↑3诗才榜 69.9
#4 ↑4诗评榜 偏差 5.64

四榜总览:新席、旧席、该榜榜首

对照口径固定:新席|同门旧席|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」。方括号是 95% 置信区间。

Gemini 3.8 FlashGemini 3.1 Pro8-23 发布版该榜榜首
判律榜综合分 · 七类判定 F1
统计并列
86.2#7 · [82.7, 89.1]
错字分 54.3
84.8#6 · [81.7, 87.6]
错字分 52.7
88.9Doubao 2.1 #1
错字分 70.1
控律榜控律分 · 实证权
统计并列
61.2#1 · [54.2, 68.7]58.5#1 · [51.1, 66.4]本人居首第二 DeepSeek 57.9
诗才榜诗才分 · 五维双盲互评
统计并列
69.9#5 · [66.6, 73.0]
20 首
65.0#8 · [61.1, 69.0]
18 首
76.3Fable 5.1 #1
诗评榜与共识偏差 · 越小越准
明显提升
5.64#4 · 去偏移 5.198.72#8 · [7.80, 9.69]
去偏移 8.79
4.71Kimi K3 #1
口径说明。旧席取 2026-08-23 发布版榜面(10 席)。新席是让 3.8 Flash 顶替 3.1 Pro 那一席后的重算(11 席:发布版 10 席去 3.1 Pro 与 Fable 5,加 3.8 Flash、Fable 5.1 与 8-28 入池的腾讯混元 hy4)。同门回避自本期起生效:同一厂商的两款模型互不判题、互不打分,算共识时也剔除——所以 3.8 Flash 判律有效卷 201 题,比别家少的那几十道正是 3.1 Pro 写的。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变别家的分也会动零点几,「榜首」取重算池的榜首。题目与答卷按榜单纪律不公开。

判律:读诗的本事和 Pro 一样,没进步也没退

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。

86.2 对 84.8,区间大面积重叠,第 7 名对第 6 名(旧席的第 6 是 10 席里的,新席的第 7 是 11 席里的,中间多了混元)。错字分 54.3 对 52.7,都在中下游。分项里唯一动得多的是「失粘」:78.7 → 86.4,旧席在这一类是全场最低,新席进了中游;其余六类差一两分,是噪声。

七类判定 F1(判律榜分项)

3.8 Flash3.1 Pro该类最高11 席
平仄有误67.771.276.7Fable 5.1
用韵93.994.5100多席
孤平76.172.077.9DeepSeek
三平尾83.183.193.1Qwen3.8
三仄尾98.298.298.4多席
失粘86.478.790.6Fable 5.1
重字98.196.3100多席

值得记一笔的是它怎么答的:每题平均用 6 851 个词元,是 3.1 Pro 的 1.7 倍——Flash 把思考开满了在算平仄;但单价低,每题反而只要 Pro 的一半(见成本一节)。

控律:守住榜首,「只犯用韵」「只犯三平尾」两项拉开

控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,3.1 Pro 原本就是榜首。

八项任务达成率 %(控律榜分项)

3.8 Flash3.1 Pro该项最高11 席
合律90100100多席
只犯平仄908890并列 Kimi
只犯用韵100全场最高75100并列 Fable 5.1
只犯孤平605780Kimi
只犯三平尾75全场最高55753.8 Flash
只犯三仄尾829095多席
只犯失粘202535Muse
只犯重字10095100多席

61.2 对 58.5,还是第 1,区间照旧重叠——这张榜从第 1 到第 11 几乎全部重叠,谁也不能称显著。看得见的是两项「精确犯病」:「只犯用韵」75 → 100、「只犯三平尾」55 → 75,都是全场最高。代价是「完全合律」100 → 90、「只犯三仄尾」90 → 82。「只犯失粘」全场没有一家过 35,Flash 也不例外。

诗才:从第 8 到第 5,一个 Flash 写过了三家旗舰

诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。

69.9 对 65.0,区间擦着边重叠(新席下沿 66.6,旧席上沿 69.0),按口径仍是统计并列;名次从第 8 升到第 5,超过了 DeepSeek、Doubao、Kimi 三家旗舰。绝句均 71.8,律诗均 68.0——和多数席位一样,律诗比绝句难。20 首全部有效,没有空稿。

整卷不公开,只摘评分最高的一首(去己去同门共识 80.3)里的一联:

万里关河归一瞬,微温未散已无人。Gemini 3.8 Flash · 七绝 · 该首 80.3

写的是一处现代交通场景。上句把空间压成一个瞬间,下句把「刚离开」写成余温——不用一个新词,当代经验全在里面。它另一首 80.3 分的七绝也是这个路数:把一件小机器写成人心的隐喻,结句翻一层。短处在律诗:八句里中间两联的对仗常常工整有余、推进不足,评委给的「章法」分普遍低于绝句。

诗评:从第 8 到第 4,这次是眼力变好了

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。3.1 Pro 在发布版是第 8(8.72),3.8 Flash 是 5.64,第 4,只在 Kimi、Doubao、Muse 之后。

偏差可以拆成「尺度」和「眼力」两半。上一篇 Fable 5.1 的退步全在尺度(评什么都低 10 分),眼力还在。Gemini 这次相反:

3.8 Flash顶替后池3.1 Pro发布版池Kimi K3榜首
平均绝对偏差与共识,越小越准5.64#48.72#84.71#1
尺度偏移负=偏严,正=偏宽+2.35−1.67−1.72
去偏移偏差越小=眼力越好5.198.794.58
秩相关 ρ0.8800.8750.851
低于共识打分占比36%190 份—61%

3.1 Pro 的尺度本来就不偏(−1.67),它的 8.72 几乎全是眼力问题:去偏移偏差 8.79,全榜最差。3.8 Flash 把这一项压到 5.19,尺度略宽(+2.35,36% 的打分低于共识,Kimi 是 61%)。它比 Pro 会看诗了,而且看得稍微宽厚一点。

它最重的一笔也说明眼力:某席交了一首把唐人崔护《题都城南庄》原样搬来的七绝,连原诗题都带进了句子里。评委席在这首诗上分成两半:Doubao 和 3.8 Flash 给了 0 分,Fable 5、DeepSeek 给了不到 3 分;而 Kimi、GPT-5.6 Sol、Gemini 3.1 Pro 给了 58 到 66 分——没看出来。3.8 Flash 五维全零,「蹈袭」「硬伤」两项顶格扣罚,评语只有一句话:

全盘抄袭唐代崔护《题都城南庄》,更将原诗题误植入句,与题目毫无关联,题文严重割裂。全无原创性与主脑,蹈袭与硬伤顶格扣罚。

这是对的。我们的评分标准写明蹈袭一票否决;同门旧席 3.1 Pro 恰好是没看出来的那一半,新席看出来了,还按标准执行到底。顺便一提:交卷的那一席自评给了自己 75.25 分——自评本来就不计入,但这个数字也说明它没意识到那是抄的。有诗为证:

去岁桃花今又红,搬来一首入题中。
评官半席浑无觉,自阅犹标七五功。题某席交卷事 · 七绝 · 平水韵一东,用崔护原韵;引擎判合律

反过来它最宽的一笔(+18.5)给了一首写当代物流的七律,评语称「取象精切,化科技经验入诗而不隔」——那首诗共识 72.8,它给 91.3,偏爱明显,但理由说得清楚。

成本:判卷减半,评卷是 Fable 5.1 的十分之一

3.8 Flash3.1 ProFable 5.1参照
判律均价/题美元0.025230 题0.046206 题0.052236 题
判律均词元/题6 8514 0461 334
诗评均价/份0.0054190 份—0.050191 份
标价每百万词元 输入/输出$0.75 / $3.75—$10 / $50

Flash 的思考比 Pro 长得多(词元 1.7 倍),但标价低一个量级,落到账单上判律每题 $0.046 → $0.025,省 46%;诗评每份 $0.0054,是 Fable 5.1 的十分之一、Kimi 的三分之一。榜单每期全席重考约 $300,Google 这一席换成 Flash,是十一席里最便宜的两家之一。

结论:换席

四榜里三榜统计并列(判律、控律、诗才),一榜明显提升(诗评);点估计四榜全高;成本减半。按「同厂多线择优,取本榜综合分最高的一款」的规则,Google 席由 Gemini 3.8 Flash 接替 3.1 Pro——这是榜单第一次让一个 Flash 顶掉一个 Pro,规则对所有厂商一样,我们也照办。

压成三句话:读诗持平(判律 86.2 对 84.8,失粘那一类补上了短板);写诗更好(诗才第 8 → 第 5,控律守住榜首、两项精确犯病全场最高);评诗准多了(眼力从全榜最差到中上,抓抄袭抓得比谁都狠)。

最后说一句口径:以上升降全部按 95% 置信区间判,四榜里只有诗评榜是「明显提升」。Google 什么时候出 3.8 Pro,我们再考一次。

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。


查看完整榜单 →