GPT-6 Astra 上榜:诗才和控律双榜首,诗评第 2;「AGI 时代」在格律诗里有几分?
2026-09-04 · 二〇二六年九月榜
OpenAI 9 月 3 日发布 GPT-6 Astra,发布会最后一句是「欢迎来到 AGI 时代」。第二天它上了 OpenRouter,我们按规矩做同门升级复测:四榜同卷,Astra 对 GPT-5.6 Sol。结果是四榜全升,其中诗才、控律两榜登顶,诗评从第 8 到第 2,判律从榜面之外进到第 8——OpenAI 席由 Astra 接替 Sol。这是榜单开办以来第一次有一席同时拿下两个榜首。文末说说一个问题:在格律诗这一小块地方,「AGI 时代」到底有几分?
外界怎么说:「欢迎来到 AGI 时代」
OpenAI 给 Astra 的定位是计算机使用、浏览、软件工程、网络安全、科学与专业工作全面领先。发布材料里的数字:ARC-AGI-3 得 98.6%,FrontierMath 第四档 97.6%,GPQA Diamond 96%,DeepSWE 1.1 得 74.1%,ExploitBench 100%;OSWorld 2.0 离线子集 72.6%,用时约 40 分钟,而 Sol 是 65.7%、75 分钟,「每个任务省 47% 的时间」。它不需要专门的接口就能直接操作浏览器、表格和桌面软件。发布会上总裁 Greg Brockman 被问到 Astra 算不算 AGI,回答是「就我个人而言,我认为我们到了」,随后补了一句「每个人对 AGI 的定义都不一样,这是件灰色、模糊的事」。
定价是标价制的一个转折:标准档输入 10、输出 50 美元每百万词元,快速档翻倍到 20 和 100,是 Sol 的五倍。Brockman 的说法是按词元计价已经过时,「你真正要看的是每个任务的价格」。上线走的是分批放开:先给门控计划 Daybreak 的企业客户,几天内到 ChatGPT 付费用户、API、AWS 和 Azure。
媒体挑出的问题有四条。头一条,ARC-AGI-3 那个 98.6% 用的是 OpenAI 自家的调用框架,别家用的配置不同,没法直接比;英伟达用 Claude Opus 5 加记忆、工具和反馈机制做成的系统也拿到过 100%,说明分数一半来自系统架构。第二条,OpenAI 自己 2025 年推出的、专门量「有经济价值的真实工作」的 GDPval 这次没有公布,与「AGI」的说法对照起来很显眼。第三条,自主性带来的管控问题:没有护栏时 Sol 有 48.2% 的概率越权行事,Astra 内测是 0%,但首席科学家 Jakub Pachocki 提醒「智能的进步不保证对齐的进步」。第四条,网络安全的双刃:Astra 在评测中发现了两个未知漏洞,高级能力先只对「可信防御方」开放;模型越强、思考词元越少,人越难看懂它在想什么,OpenAI 说必要时会「暂停扩张,直到有足够信心」。
这些评测同样没有一项碰过中文,也没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉,有没有真本事藏不住。
四榜总览:新席、同门旧席、该榜榜首
对照口径固定:新席|同门旧席|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,两版同题配对重采样的差值区间不含零才写「明显」。方括号是 95% 置信区间。
| GPT-6 Astra | GPT-5.6 Sol9-2 发布版 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 明显提升 | 84.4#8 · [81.3, 87.0] 错字分 56.1 | 81.7榜面之外 · [78.7, 84.7] 错字分 39.3 | 88.9Doubao 2.1 #1 错字分 70.1 |
| 控律榜控律分 · 实证权 统计并列 · 登顶 | 63.9#1 · [56.3, 71.6] | 55.1#5 · [49.2, 61.7] | 本人居首第二 Gemini 3.8 Flash 61.0 |
| 诗才榜诗才分 · 五维双盲互评 明显提升 · 登顶 | 82.9#1 · [81.9, 84.1] 20 首 | 74.4#3 · [72.0, 76.9] 18 首 | 本人居首第二 Fable 5.1 75.4 |
| 诗评榜与共识偏差 · 越小越准 明显提升 | 4.84#2 · 去偏移 4.32 | 7.56#8 · [6.95, 8.18] 去偏移 3.79 | 4.61Kimi K3 #1 |
判律:从榜面之外进到第 8,错字定位涨了 17 分
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。
84.4 对 81.7,208 道同题配对高 2.6 分,重采样一千次的差值区间 [+0.8, +4.4],不含零——明显提升。更大的变化在错字分:39.3 → 56.1,涨了 17 分,从全榜最低进到中游。这一项考的是「错在哪个字」,Sol 常常判对了病类却指不准字,Astra 指准的多了。
七类判定 F1(判律榜分项)
| Astra | 5.6 Sol | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 55.7 | 47.9 | 76.7Fable 5.1 |
| 用韵 | 100并列最高 | 98.0 | 100多席 |
| 孤平 | 66.7 | 60.0 | 77.9DeepSeek |
| 三平尾 | 82.4 | 82.4 | 93.1Qwen3.8 |
| 三仄尾 | 98.2 | 98.2 | 98.4多席 |
| 失粘 | 87.7 | 87.7 | 90.6Fable 5.1 |
| 重字 | 100并列最高 | 98.2 | 100多席 |
涨在两类最难的判定上:平仄有误 47.9 → 55.7,孤平 60.0 → 66.7;用韵和重字补到满分。三尾和失粘一分未动,本来就在高位。但要说清楚:平仄有误 55.7 离 Fable 5.1 的 76.7 还有 21 分,判律榜它是第 8,不是前三。读诗,它仍是中游。它答题的方式倒和别家不同:每题只用 1 448 个词元,比 Sol 的 1 968 还少四分之一,8 秒出结果。想得更少,判得更准,OpenAI 说的「模型越强、思考词元越少」在这里看得见。
控律:登顶,「只犯失粘」10 → 30
控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,上一期的榜首是 Gemini 3.8 Flash。
八项任务达成率 %(控律榜分项)
| Astra | 5.6 Sol | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 100并列最高 | 95 | 100多席 |
| 只犯平仄 | 80 | 82 | 90Kimi、3.8 Flash |
| 只犯用韵 | 100并列最高 | 90 | 100多席 |
| 只犯孤平 | 70 | 55 | 80Kimi |
| 只犯三平尾 | 55 | 60 | 753.8 Flash |
| 只犯三仄尾 | 95并列最高 | 95 | 95多席 |
| 只犯失粘 | 30 | 10 | 35Muse |
| 只犯重字 | 100 | 100 | 100多席 |
63.9 对 55.1,从第 5 升到第 1,把 3.8 Flash 的 61.0 挤到第二。同任务 160 首配对,差值 +9.0,区间 [−1.2, +18.4],下沿刚过零一点点——按口径仍是统计并列;这张榜从第 1 到第 11 的区间几乎全部重叠,谁也不能称显著。分项里三项并列最高(合律、只犯用韵、只犯三仄尾),只犯失粘 10 → 30,是全场公认最难控的一种病,只有 Muse 的 35 比它高。掉的两项是只犯平仄 82 → 80、只犯三平尾 60 → 55,都在噪声里。
诗才:登顶,领先第二名 7 分半
诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。
82.9 对 74.4,区间不相交(新席下沿 81.9,旧席上沿 76.9),明显提升;而且是登顶,第二名 Fable 5.1 是 75.4,差了 7 分半——这张榜上一期前三名挤在 73 到 76 之间,从没有人拉开过这么大的距离。绝句均 83.1,律诗均 82.8,两种体裁几乎一样,别家几乎都是律诗明显低于绝句。20 首全部有效,最低的一首也有 78.9,比多数席位的最高分还高。我们把它 120 行诗逐句与语料库比对,没有一行与古人重合。
整卷不公开,只摘评分最高的一首(去己去同门共识 89.3)里的一联:
前两句只是叙事:一件旧衣叠好又拿起,几番犹豫;到这一联,剪掉名签是把「自己」从这件衣服上抹去,箱门一闭是告别,而针痕还记得——物比人长情,当代生活里的一点不忍,全靠一个细节托住。它另一首 86 分的七绝结句「新衾已覆旧时床」也是这个路数:不说想念,只说一床新被子。评委给它的「立意」「余味」两项多在 85 分以上,这在这张榜上以前没见过。
诗评:从第 8 到第 2,尺度回正,眼力略退
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。Sol 在发布版是第 8(7.56),是全榜最宽的评委;Astra 是 4.84,第 2,只在 Kimi 之后。
偏差可以拆成「尺度」和「眼力」两半:
| Astra顶替后池 | 5.6 Sol发布版池 | Kimi K3榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 4.84#2 | 7.56#8 | 4.61#1 |
| 尺度偏移负=偏严,正=偏宽 | −3.03 | +7.31 | −0.92 |
| 去偏移偏差越小=眼力越好 | 4.32 | 3.79 | 4.61 |
| 秩相关 ρ | 0.888 | — | 0.877 |
| 低于共识打分占比 | 70%155 份 | — | 61% |
Sol 的 7.56 几乎全是尺度问题:评什么都比共识高 7 分,去掉偏移后只剩 3.79,眼力其实是全榜最好的一档。Astra 把尺度收回来了(−3.03,略严),名次从第 8 升到第 2;但去偏移偏差 4.32 比 Sol 的 3.79 略大。它比 Sol 严了,眼力却没有 Sol 好。排序一致性 0.888 倒是全榜最高:单首的分它偶尔看走眼,谁好谁差它排得最准。
它最严的一笔(−19)给了一首七律,共识 70.7,它给 51.75,评语说得具体:「后半转议平直……结句语意欠稳,夕阳添景而情景融合不足」。最宽的一笔(+9)给了一首七绝,理由是「有效融入当代经验,脉络清楚」——宽得有限,理由也说得清楚。
还有一件事:Astra 的评委调用不稳定,193 单里有 38 单返回空白,补跑一次仍然空白,最后按 155 份有效计。上一期各家分歧最大的那首抄袭之作就在空白之列,它会怎么判,我们不知道。这不影响榜面,但一个「AGI 时代」的模型有五分之一的评卷交白卷,得记下来。
成本:想得少了,标价却贵五倍
| Astra | 5.6 Sol | 3.8 Flash参照 | |
|---|---|---|---|
| 判律均价/题美元 | 0.060208 题 | 0.051208 题 | 0.025230 题 |
| 判律均词元/题 | 1 448 | 1 968 | 6 851 |
| 诗评均价/份 | 0.044155 份 | 0.0061192 份 | 0.0054190 份 |
| 标价每百万词元 输入/输出 | $10 / $50 | $2 / $10 | $0.75 / $3.75 |
标价是 Sol 的五倍,判律每题却只贵 18%,因为它用的词元少了四分之一,Brockman 说的「按任务算价」指的就是这个。诗评那一轨没有这个便宜可占,每份 0.044 美元,是 Sol 的七倍、Flash 的八倍。四轨复测合计约 40 美元,加上 Astra Pro 的判律卷 36 美元;OpenAI 这一席从此是十一席里最贵的一家。
「AGI 时代」在格律诗里有几分?
Brockman 说他个人认为「到了」。我们这四张卷子不足以裁决 AGI,但可以回答一个更小的问题:一个被称为 AGI 的模型,在一件它没被专门训练过的小事上,表现像不像一个通才?
像的地方,先是它一进场就同时拿下两个榜首,而且是「写」的两个榜——命题写诗考才情,按令控律考规则,此前从没有一家两头都强。再是它写得像懂了这件事,不像背下了套路:立意和余味两项高分,题材全是当代生活,逐句查重没有古人的句子;律诗不比绝句差,而大多数模型写律诗时中间两联对仗一工整就把气写断了。还有它想得少却判得准:判律每题 1 448 个词元,是全席最省的两家之一,分数却比想得更多的同门高。
不像的地方也明摆着。读诗仍是中游:判律第 8,平仄判定 55.7 离榜首 76.7 差 21 分;一首诗哪个字出律,规则引擎能百分之百指出来,它指不到六成,「会写不等于会判」这句话对它也成立。评卷五分之一交白卷,能力再高,不稳就还是工具,算不上「AGI 时代」。它又是最贵的一席。
所以在格律诗这一小块地方,Astra 是目前最像通才的模型,离「AGI 时代」还差两样东西:判律上的确定性,评卷上的稳定性。前者有现成的量尺——哪天一个语言模型在判律榜上追平规则引擎,「AGI」这个词在我们这里才算数。
结论:换席
四榜里三榜明显提升(判律、诗才、诗评),一榜统计并列但登顶(控律);点估计四榜全高;成本贵五倍但按任务算贵得有限。按「同厂多线择优,取本榜综合分最高的一款」的规则,OpenAI 席由 GPT-6 Astra 接替 GPT-5.6 Sol。
压成三句话:写得最好(诗才 82.9 登顶,领先 7 分半);控得最稳(控律 63.9 登顶,只犯失粘从 10 到 30);评得准了(尺度从最宽回到略严,第 8 → 第 2)。读诗仍是中游,这是它下一版要补的课。
附:ChatGPT 该不该订,订哪一档
常有读者问:为了写诗、改诗、评诗,值不值得为 Astra 掏钱?各档位的 Astra 权限还在分批放开,下表是 9 月 4 日各家报道的口径,以官方页面为准。
| 档位月费 · 美元 | Astra | Astra Pro选单里叫 GPT-6 Pro | 适合谁 |
|---|---|---|---|
| Free / Go0 / 低价 | 无给的是 5.6 Luna | 无 | 偶尔写一首的人 |
| Plus20 | 有限额,用完可买 | 无 | 常写诗、改诗的人 |
| Pro100 / 200 | 有全额 | 每周 50 / 200 条 | 整天用它干活的人 |
| Business标准 / 高级 | 有标准档限量 | 每月 15 / 每周 50 条 | 团队,写诗不是重点 |
| API按量 | 10 / 50每百万词元 输入/输出 | 同价 | 做工具、批量评卷 |
就格律诗词这一件事,小结四句:偶尔写写的不必订,免费模型加本站的格律检测就够,出律的字反正要靠引擎抓;常写的订 Plus,20 美元拿到的就是本文考的这个 Astra,写诗登顶、评诗第 2;别为诗买 Pro,Astra Pro 判律与普通版并列,每题贵三倍,长处在长任务不在诗;批量评卷走 API 并留重试,每首约 0.044 美元,但本期有五分之一的评卷调用返回空白,而 Kimi K3 评得更准、只要十分之一的钱。预算紧的看 Gemini 3.8 Flash,四轨中上,标价是 Astra 的十三分之一。
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。外界评测与档位数据引自 OpenAI 发布材料以及 VentureBeat、9to5Mac 等公开报道。