GPT-6 Sol 上诗韵榜:判律追平 Astra,花费只要五分之一,写诗差一截
2026-09-24 · 二〇二六年九月榜
9 月 22 日 OpenAI 在 OpenRouter 上架 GPT-6 Sol,标价每百万词元输入 2 美元、输出 10 美元,是本家旗舰 GPT-6 Astra 的五分之一。OpenAI 席位现在是 Astra,按「同厂多线择优」的规则,我们让 Sol 四榜同卷对考。结论先放在这里:判律与 Astra 统计并列,每题花费只有它的五分之一;控律、诗才明显不如 Astra,诗评给分偏严。Astra 继续占 OpenAI 席位,Sol 存档,不上榜。
四榜总览:Sol、同门在席、该榜榜首
对照口径固定:受测型号|同门在席|该榜当期榜首。Sol 和 Astra 是 OpenAI 同一代的两条产品线,Astra 在席,所以第二栏是 Astra。升降只按 95% 置信区间判,区间重叠一律写「统计并列」;判律、控律另做同卷配对重采样,差值区间不含零才写「明显」。方括号是 95% 置信区间。
| GPT-6 Sol | GPT-6 Astra同门在席 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 统计并列 | 83.8[80.7, 86.2] 错字分 61.8 | 84.4#9 · [81.3, 87.0] 错字分 56.1 | 88.9Doubao Seed 2.1 |
| 控律榜控律分 · 实证权 明显低 | 84.7[78.9, 89.8] | 93.6#2 · [89.7, 97.1] | 93.7Qwen3.8 Max |
| 诗才榜诗才分 · 五维双盲互评 明显低 | 76.9[74.1, 79.4] 零出律 95% | 83.3#1 · [82.3, 84.5] 零出律 100% | 本栏即榜首GPT-6 Astra |
| 诗评榜与共识偏差 · 越小越准 明显低 | 6.08[5.49, 6.68] 去偏移 4.12 · ρ 0.911 | 4.03#1 · [3.53, 4.59] 去偏移 3.88 · ρ 0.905 | 本栏即榜首GPT-6 Astra |
判律:追平旗舰,错字定位反而更好
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。
Sol 综合 83.8,Astra 84.4,208 道同题配对差值 −0.6,区间 [−2.7, +1.4],并列。错字分 Sol 61.8,反而比 Astra 的 56.1 高;「平仄有误」62.6 对 55.7,也是 Sol 更好。Astra 领先的是失粘和孤平两类,各高三到四分。
和同一条线的上一代 GPT-5.6 Sol 比:综合 83.8 对 81.7,配对差值 +2.0,区间 [−0.4, +4.4],刚好含零,只能算并列;但错字分从 39.3 跳到 61.8,涨了 22.5 分,是这一代最明显的进步。
控律:明显不如 Astra,短板在失粘和用韵
控律榜考的是「写」的另一面:命模型按令作七绝,要么完全合律,要么只犯指定的某一种病、其余全对。
八项任务达成率 %(控律榜分项)
| GPT-6 Sol | GPT-6 Astra | |
|---|---|---|
| 合律 | 95 | 100 |
| 只犯平仄 | 95 | 100 |
| 只犯用韵 | 80 | 100 |
| 只犯孤平 | 80 | 85 |
| 只犯三平尾 | 95 | 90 |
| 只犯三仄尾 | 88 | 100 |
| 只犯失粘 | 57 | 80 |
| 只犯重字 | 100 | 100 |
84.7 对 93.6,配对差值 −9.0,区间 [−15.1, −2.7],不含零,明显低。八项里七项持平或落后,差得最多的是「只犯失粘」57 对 80、「只犯用韵」80 对 100。这两项都要先把整首正格写对,再精确地挪动一处,Sol 的控制力不如旗舰。和 GPT-5.6 Sol 的 87.1 比,配对差值 −2.4,区间 [−9.2, +4.6],并列,这一代在按令写诗上没有进步。
诗才:明显不如 Astra,但放进榜里能排第三
诗才榜是 10 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分,不合律的作品按声律系数折算。题目是当期机密,这里不列。
Sol 得 76.9,区间 [74.1, 79.4];Astra 83.3 [82.3, 84.5],两者区间不相交,明显低。但这个分数放进在榜 11 席里能排第三,仅次于 Astra 和 Claude Opus 5.5,高于其余八家。20 首里 19 首零出律;重字率 10%,比 Astra 的 0% 高。
整卷不公开,只摘它共识分最高的一首七律(85.2)的尾联:
前面几联在屏幕上翻看旧照,看见童年,也看见照片里的母亲容颜未改、屏幕前的孩子已经白了头。到结尾,重逢只隔一层玻璃,想喊一声「阿娘」,手指停在半空。一个当代动作,写出了隔世之感。
诗评:看诗不差,给分偏严
| GPT-6 Sol | GPT-6 Astra榜首 | |
|---|---|---|
| 平均绝对偏差与共识,越小越准 | 6.08 | 4.03 |
| 尺度偏移负=偏严,正=偏宽 | −5.38 | −1.29 |
| 去偏移偏差越小=眼力越好 | 4.12 | 3.88 |
| 秩相关 ρ | 0.911 | 0.905 |
6.08 对 4.03,区间不相交,按现行口径明显低,放进榜里排第六。但差距大半是尺度:Sol 给分平均比共识低 5.4 分,Astra 只低 1.3 分。扣掉这个偏移,偏差 4.12 对 3.88,相差无几;排序一致性 0.911,比 Astra 还略高。它看诗的眼力和旗舰相当,只是下手更重。
成本:五分之一的价钱
| GPT-6 Sol | GPT-6 Astra | |
|---|---|---|
| 判律均价/题美元 | 0.012 | 0.060 |
| 判律均词元/题 | 1 425 | 1 447 |
| 诗评均价/份美元 | 0.009 | 0.044 |
| 标价每百万词元 输入/输出 | $2 / $10 | $10 / $50 |
两者每题用的词元几乎一样,所以账单就是标价之比:判律每题 0.012 美元对 0.060 美元,诗评每份 0.009 美元对 0.044 美元,都是五分之一。
结论:读诗追平旗舰,写诗不如旗舰
读诗追平了。判律与 Astra 并列,错字定位还更好;比上一代 GPT-5.6 Sol,错字分涨了 22.5 分。
写诗差一截。控律、诗才都明显低于 Astra,控律比上一代也没有进步。
评诗偏严。眼力与 Astra 相当,给分平均低 5 分多。
四榜里一榜并列、三榜明显低,按「同厂多线择优」,Astra 继续占 OpenAI 席位,Sol 存档不上榜。只要读诗、判律的场合,Sol 用五分之一的价钱就能拿到旗舰的水平。
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。