‹返回
择优考
择优考

GPT-6 Sol 上诗韵榜:判律追平 Astra,花费只要五分之一,写诗差一截

2026-09-24 · 二〇二六年九月榜

9 月 22 日 OpenAI 在 OpenRouter 上架 GPT-6 Sol,标价每百万词元输入 2 美元、输出 10 美元,是本家旗舰 GPT-6 Astra 的五分之一。OpenAI 席位现在是 Astra,按「同厂多线择优」的规则,我们让 Sol 四榜同卷对考。结论先放在这里:判律与 Astra 统计并列,每题花费只有它的五分之一;控律、诗才明显不如 Astra,诗评给分偏严。Astra 继续占 OpenAI 席位,Sol 存档,不上榜。

并列判律 83.8 · Astra 84.4
明显低控律 84.7 · Astra 93.6
明显低诗才 76.9 · Astra 83.3
1/5判律每题花费 · 对 Astra

四榜总览:Sol、同门在席、该榜榜首

对照口径固定:受测型号|同门在席|该榜当期榜首。Sol 和 Astra 是 OpenAI 同一代的两条产品线,Astra 在席,所以第二栏是 Astra。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。

GPT-6 SolGPT-6 Astra同门在席该榜榜首
判律榜综合分 · 七类判定 F1
统计并列
83.8[80.7, 86.2]
错字分 61.8
84.4#9 · [81.3, 87.0]
错字分 56.1
88.9Doubao Seed 2.1
控律榜控律分 · 实证权
明显低
84.7[78.9, 89.8]93.6#2 · [89.7, 97.1]93.7Qwen3.8 Max
诗才榜诗才分 · 五维双盲互评
明显低
76.9[74.1, 79.4]
零出律 95%
83.3#1 · [82.3, 84.5]
零出律 100%
本栏即榜首GPT-6 Astra
诗评榜与共识偏差 · 越小越准
明显低
6.08[5.49, 6.68]
去偏移 4.12 · ρ 0.911
4.03#1 · [3.53, 4.59]
去偏移 3.88 · ρ 0.905
本栏即榜首GPT-6 Astra
口径说明。Sol 是存档席,不在正式榜面上,所以表里不给它排名次。判律、控律由规则引擎判分,各席互不影响,Sol 与 Astra 的分数直接取自同一套题。诗才、诗评是互评榜:为了算出 Sol 的这两项,我们在同一批作品和评委下把 Sol 临时放进评委席重算,Astra 的数字取自这次重算,所以与正式榜面相差零点几。同门回避照旧:Sol 与 Astra 同属 OpenAI,互不判题、互不打分,算共识时也剔除。判律 208 题(同门回避后)、控律 160 首、诗才 10 个命题各写七绝七律、诗评 194 份打分。题目与答卷按榜单纪律不公开。

判律:追平旗舰,错字定位反而更好

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。

Sol 综合 83.8,Astra 84.4,208 道同题配对差值 −0.6,区间 [−2.7, +1.4],并列。错字分 Sol 61.8,反而比 Astra 的 56.1 高;「平仄有误」62.6 对 55.7,也是 Sol 更好。Astra 领先的是失粘和孤平两类,各高三到四分。

和同一条线的上一代 GPT-5.6 Sol 比:综合 83.8 对 81.7,配对差值 +2.0,区间 [−0.4, +4.4],刚好含零,只能算并列;但错字分从 39.3 跳到 61.8,涨了 22.5 分,是这一代最明显的进步。

控律:明显不如 Astra,短板在失粘和用韵

控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。

八项任务达成率 %(控律榜分项)

GPT-6 SolGPT-6 Astra
合律95100
只犯平仄95100
只犯用韵80100
只犯孤平8085
只犯三平尾9590
只犯三仄尾88100
只犯失粘5780
只犯重字100100

84.7 对 93.6,配对差值 −9.0,区间 [−15.1, −2.7],不含零,明显低。八项里七项持平或落后,差得最多的是「只犯失粘」57 对 80、「只犯用韵」80 对 100。这两项都要先把整首正格写对,再精确地挪动一处,Sol 的控制力不如旗舰。和 GPT-5.6 Sol 的 87.1 比,配对差值 −2.4,区间 [−9.2, +4.6],并列,这一代在按令写诗上没有进步。

诗才:明显不如 Astra,但放进榜里能排第三

诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。

Sol 得 76.9,区间 [74.1, 79.4];Astra 83.3 [82.3, 84.5],两者区间不相交,明显低。但这个分数放进在榜 11 席里能排第三,仅次于 Astra 和 Claude Opus 5.5,高于其余八家。20 首里 19 首零出律;重字率 10%,比 Astra 的 0% 高。

整卷不公开,只摘它共识分最高的一首七律(85.2)的尾联:

重逢只隔玻璃面,欲唤阿娘指半悬。GPT-6 Sol · 七律 · 该首共识 85.2

前面几联在屏幕上翻看旧照,看见童年,也看见照片里的母亲容颜未改、屏幕前的孩子已经白了头。到结尾,重逢只隔一层玻璃,想喊一声「阿娘」,手指停在半空。一个当代动作,写出了隔世之感。

诗评:看诗不差,给分偏严

GPT-6 SolGPT-6 Astra榜首
平均绝对偏差与共识,越小越准6.084.03
尺度偏移负=偏严,正=偏宽−5.38−1.29
去偏移偏差越小=眼力越好4.123.88
秩相关 ρ0.9110.905

6.08 对 4.03,区间不相交,按现行口径明显低,放进榜里排第六。但差距大半是尺度:Sol 给分平均比共识低 5.4 分,Astra 只低 1.3 分。扣掉这个偏移,偏差 4.12 对 3.88,相差无几;排序一致性 0.911,比 Astra 还略高。它看诗的眼力和旗舰相当,只是下手更重。

成本:五分之一的价钱

GPT-6 SolGPT-6 Astra
判律均价/题美元0.0120.060
判律均词元/题1 4251 447
诗评均价/份美元0.0090.044
标价每百万词元 输入/输出$2 / $10$10 / $50

两者每题用的词元几乎一样,所以账单就是标价之比:判律每题 0.012 美元对 0.060 美元,诗评每份 0.009 美元对 0.044 美元,都是五分之一。

结论:读诗追平旗舰,写诗不如旗舰

读诗追平了。判律与 Astra 并列,错字定位还更好;比上一代 GPT-5.6 Sol,错字分涨了 22.5 分。

写诗差一截。控律、诗才都明显低于 Astra,控律比上一代也没有进步。

评诗偏严。眼力与 Astra 相当,给分平均低 5 分多。

四榜里一榜并列、三榜明显低,按「同厂多线择优」,Astra 继续占 OpenAI 席位,Sol 存档不上榜。只要读诗、判律的场合,Sol 用五分之一的价钱就能拿到旗舰的水平。

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。


查看完整榜单 →