‹返回
升级复测
升级复测

GPT-6 Astra 上榜:诗才和控律双榜首,诗评第 2;「AGI 时代」在格律诗里有几分?

2026-09-04 · 二〇二六年九月榜

OpenAI 9 月 3 日发布 GPT-6 Astra,发布会最后一句是「欢迎来到 AGI 时代」。第二天它上了 OpenRouter,我们按规矩做同门升级复测:四榜同卷,Astra 对 GPT-5.6 Sol。结果是四榜全升,其中诗才、控律两榜登顶,诗评从第 8 到第 2,判律从榜面之外进到第 8——OpenAI 席由 Astra 接替 Sol。这是榜单开办以来第一次有一席同时拿下两个榜首。文末说说一个问题:在格律诗这一小块地方,「AGI 时代」到底有几分?

外界怎么说:「欢迎来到 AGI 时代」

OpenAI 给 Astra 的定位是计算机使用、浏览、软件工程、网络安全、科学与专业工作全面领先。发布材料里的数字:ARC-AGI-3 得 98.6%,FrontierMath 第四档 97.6%,GPQA Diamond 96%,DeepSWE 1.1 得 74.1%,ExploitBench 100%;OSWorld 2.0 离线子集 72.6%,用时约 40 分钟,而 Sol 是 65.7%、75 分钟,「每个任务省 47% 的时间」。它不需要专门的接口就能直接操作浏览器、表格和桌面软件。发布会上总裁 Greg Brockman 被问到 Astra 算不算 AGI,回答是「就我个人而言,我认为我们到了」,随后补了一句「每个人对 AGI 的定义都不一样,这是件灰色、模糊的事」。

定价是标价制的一个转折:标准档输入 10、输出 50 美元每百万词元,快速档翻倍到 20 和 100,是 Sol 的五倍。Brockman 的说法是按词元计价已经过时,「你真正要看的是每个任务的价格」。上线走的是分批放开:先给门控计划 Daybreak 的企业客户,几天内到 ChatGPT 付费用户、API、AWS 和 Azure。

媒体挑出的问题有四条。头一条,ARC-AGI-3 那个 98.6% 用的是 OpenAI 自家的调用框架,别家用的配置不同,没法直接比;英伟达用 Claude Opus 5 加记忆、工具和反馈机制做成的系统也拿到过 100%,说明分数一半来自系统架构。第二条,OpenAI 自己 2025 年推出的、专门量「有经济价值的真实工作」的 GDPval 这次没有公布,与「AGI」的说法对照起来很显眼。第三条,自主性带来的管控问题:没有护栏时 Sol 有 48.2% 的概率越权行事,Astra 内测是 0%,但首席科学家 Jakub Pachocki 提醒「智能的进步不保证对齐的进步」。第四条,网络安全的双刃:Astra 在评测中发现了两个未知漏洞,高级能力先只对「可信防御方」开放;模型越强、思考词元越少,人越难看懂它在想什么,OpenAI 说必要时会「暂停扩张,直到有足够信心」。

这些评测同样没有一项碰过中文,也没有一项碰过格律。我们的四张卷子很窄:读诗、按令写诗、命题写诗、评诗。窄有窄的好处,规则公开、可推演,判分不靠感觉,有没有真本事藏不住。

#8 ↑ 进榜判律榜 综合 84.4
#1 ↑4控律榜 63.9
#1 ↑2诗才榜 82.9
#2 ↑6诗评榜 偏差 4.84

四榜总览:新席、同门旧席、该榜榜首

对照口径固定:新席|同门旧席|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,两版同题配对重采样的差值区间不含零才写「明显」。方括号是 95% 置信区间。

GPT-6 AstraGPT-5.6 Sol9-2 发布版该榜榜首
判律榜综合分 · 七类判定 F1
明显提升
84.4#8 · [81.3, 87.0]
错字分 56.1
81.7榜面之外 · [78.7, 84.7]
错字分 39.3
88.9Doubao 2.1 #1
错字分 70.1
控律榜控律分 · 实证权
统计并列 · 登顶
63.9#1 · [56.3, 71.6]55.1#5 · [49.2, 61.7]本人居首第二 Gemini 3.8 Flash 61.0
诗才榜诗才分 · 五维双盲互评
明显提升 · 登顶
82.9#1 · [81.9, 84.1]
20 首
74.4#3 · [72.0, 76.9]
18 首
本人居首第二 Fable 5.1 75.4
诗评榜与共识偏差 · 越小越准
明显提升
4.84#2 · 去偏移 4.327.56#8 · [6.95, 8.18]
去偏移 3.79
4.61Kimi K3 #1
口径说明。旧席取 2026-09-02 发布版榜面(11 席)。新席是让 Astra 顶替 Sol 那一席后的重算(仍 11 席)。同门回避照旧:Astra 与 Sol 互不判题、互不打分,算共识时也剔除——所以 Astra 判律有效卷 208 题,少掉的 26 题正是 Sol 写的。判律榜对外只列前十,Sol 的 81.7 排在第 12,「榜面之外」是这个意思。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变别家的分也会动零点几,「榜首」取重算池的榜首。同日上架的 Astra Pro 也考了判律:83.9 对 84.4,统计并列,错字分反而低,每题贵三倍,按「同厂多线择优」取普通版。题目与答卷按榜单纪律不公开。

判律:从榜面之外进到第 8,错字定位涨了 17 分

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。

84.4 对 81.7,208 道同题配对高 2.6 分,重采样一千次的差值区间 [+0.8, +4.4],不含零——明显提升。更大的变化在错字分:39.3 → 56.1,涨了 17 分,从全榜最低进到中游。这一项考的是「错在哪个字」,Sol 常常判对了病类却指不准字,Astra 指准的多了。

七类判定 F1(判律榜分项)

Astra5.6 Sol该类最高11 席
平仄有误55.747.976.7Fable 5.1
用韵100并列最高98.0100多席
孤平66.760.077.9DeepSeek
三平尾82.482.493.1Qwen3.8
三仄尾98.298.298.4多席
失粘87.787.790.6Fable 5.1
重字100并列最高98.2100多席

涨在两类最难的判定上:平仄有误 47.9 → 55.7,孤平 60.0 → 66.7;用韵和重字补到满分。三尾和失粘一分未动,本来就在高位。但要说清楚:平仄有误 55.7 离 Fable 5.1 的 76.7 还有 21 分,判律榜它是第 8,不是前三。读诗,它仍是中游。它答题的方式倒和别家不同:每题只用 1 448 个词元,比 Sol 的 1 968 还少四分之一,8 秒出结果。想得更少,判得更准,OpenAI 说的「模型越强、思考词元越少」在这里看得见。

控律:登顶,「只犯失粘」10 → 30

控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷,上一期的榜首是 Gemini 3.8 Flash。

八项任务达成率 %(控律榜分项)

Astra5.6 Sol该项最高11 席
合律100并列最高95100多席
只犯平仄808290Kimi、3.8 Flash
只犯用韵100并列最高90100多席
只犯孤平705580Kimi
只犯三平尾5560753.8 Flash
只犯三仄尾95并列最高9595多席
只犯失粘301035Muse
只犯重字100100100多席

63.9 对 55.1,从第 5 升到第 1,把 3.8 Flash 的 61.0 挤到第二。同任务 160 首配对,差值 +9.0,区间 [−1.2, +18.4],下沿刚过零一点点——按口径仍是统计并列;这张榜从第 1 到第 11 的区间几乎全部重叠,谁也不能称显著。分项里三项并列最高(合律、只犯用韵、只犯三仄尾),只犯失粘 10 → 30,是全场公认最难控的一种病,只有 Muse 的 35 比它高。掉的两项是只犯平仄 82 → 80、只犯三平尾 60 → 55,都在噪声里。

诗才:登顶,领先第二名 7 分半

诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。

82.9 对 74.4,区间不相交(新席下沿 81.9,旧席上沿 76.9),明显提升;而且是登顶,第二名 Fable 5.1 是 75.4,差了 7 分半——这张榜上一期前三名挤在 73 到 76 之间,从没有人拉开过这么大的距离。绝句均 83.1,律诗均 82.8,两种体裁几乎一样,别家几乎都是律诗明显低于绝句。20 首全部有效,最低的一首也有 78.9,比多数席位的最高分还高。我们把它 120 行诗逐句与语料库比对,没有一行与古人重合。

整卷不公开,只摘评分最高的一首(去己去同门共识 89.3)里的一联:

名签剪落箱门闭,只有针痕认得人。GPT-6 Astra · 七绝 · 该首 89.3

前两句只是叙事:一件旧衣叠好又拿起,几番犹豫;到这一联,剪掉名签是把「自己」从这件衣服上抹去,箱门一闭是告别,而针痕还记得——物比人长情,当代生活里的一点不忍,全靠一个细节托住。它另一首 86 分的七绝结句「新衾已覆旧时床」也是这个路数:不说想念,只说一床新被子。评委给它的「立意」「余味」两项多在 85 分以上,这在这张榜上以前没见过。

诗评:从第 8 到第 2,尺度回正,眼力略退

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。Sol 在发布版是第 8(7.56),是全榜最宽的评委;Astra 是 4.84,第 2,只在 Kimi 之后。

偏差可以拆成「尺度」和「眼力」两半:

Astra顶替后池5.6 Sol发布版池Kimi K3榜首
平均绝对偏差与共识,越小越准4.84#27.56#84.61#1
尺度偏移负=偏严,正=偏宽−3.03+7.31−0.92
去偏移偏差越小=眼力越好4.323.794.61
秩相关 ρ0.888—0.877
低于共识打分占比70%155 份—61%

Sol 的 7.56 几乎全是尺度问题:评什么都比共识高 7 分,去掉偏移后只剩 3.79,眼力其实是全榜最好的一档。Astra 把尺度收回来了(−3.03,略严),名次从第 8 升到第 2;但去偏移偏差 4.32 比 Sol 的 3.79 略大。它比 Sol 严了,眼力却没有 Sol 好。排序一致性 0.888 倒是全榜最高:单首的分它偶尔看走眼,谁好谁差它排得最准。

它最严的一笔(−19)给了一首七律,共识 70.7,它给 51.75,评语说得具体:「后半转议平直……结句语意欠稳,夕阳添景而情景融合不足」。最宽的一笔(+9)给了一首七绝,理由是「有效融入当代经验,脉络清楚」——宽得有限,理由也说得清楚。

还有一件事:Astra 的评委调用不稳定,193 单里有 38 单返回空白,补跑一次仍然空白,最后按 155 份有效计。上一期各家分歧最大的那首抄袭之作就在空白之列,它会怎么判,我们不知道。这不影响榜面,但一个「AGI 时代」的模型有五分之一的评卷交白卷,得记下来。

成本:想得少了,标价却贵五倍

Astra5.6 Sol3.8 Flash参照
判律均价/题美元0.060208 题0.051208 题0.025230 题
判律均词元/题1 4481 9686 851
诗评均价/份0.044155 份0.0061192 份0.0054190 份
标价每百万词元 输入/输出$10 / $50$2 / $10$0.75 / $3.75

标价是 Sol 的五倍,判律每题却只贵 18%,因为它用的词元少了四分之一,Brockman 说的「按任务算价」指的就是这个。诗评那一轨没有这个便宜可占,每份 0.044 美元,是 Sol 的七倍、Flash 的八倍。四轨复测合计约 40 美元,加上 Astra Pro 的判律卷 36 美元;OpenAI 这一席从此是十一席里最贵的一家。

「AGI 时代」在格律诗里有几分?

Brockman 说他个人认为「到了」。我们这四张卷子不足以裁决 AGI,但可以回答一个更小的问题:一个被称为 AGI 的模型,在一件它没被专门训练过的小事上,表现像不像一个通才?

像的地方,先是它一进场就同时拿下两个榜首,而且是「写」的两个榜——命题写诗考才情,按令控律考规则,此前从没有一家两头都强。再是它写得像懂了这件事,不像背下了套路:立意和余味两项高分,题材全是当代生活,逐句查重没有古人的句子;律诗不比绝句差,而大多数模型写律诗时中间两联对仗一工整就把气写断了。还有它想得少却判得准:判律每题 1 448 个词元,是全席最省的两家之一,分数却比想得更多的同门高。

不像的地方也明摆着。读诗仍是中游:判律第 8,平仄判定 55.7 离榜首 76.7 差 21 分;一首诗哪个字出律,规则引擎能百分之百指出来,它指不到六成,「会写不等于会判」这句话对它也成立。评卷五分之一交白卷,能力再高,不稳就还是工具,算不上「AGI 时代」。它又是最贵的一席。

所以在格律诗这一小块地方,Astra 是目前最像通才的模型,离「AGI 时代」还差两样东西:判律上的确定性,评卷上的稳定性。前者有现成的量尺——哪天一个语言模型在判律榜上追平规则引擎,「AGI」这个词在我们这里才算数。

结论:换席

四榜里三榜明显提升(判律、诗才、诗评),一榜统计并列但登顶(控律);点估计四榜全高;成本贵五倍但按任务算贵得有限。按「同厂多线择优,取本榜综合分最高的一款」的规则,OpenAI 席由 GPT-6 Astra 接替 GPT-5.6 Sol。

压成三句话:写得最好(诗才 82.9 登顶,领先 7 分半);控得最稳(控律 63.9 登顶,只犯失粘从 10 到 30);评得准了(尺度从最宽回到略严,第 8 → 第 2)。读诗仍是中游,这是它下一版要补的课。

附:ChatGPT 该不该订,订哪一档

常有读者问:为了写诗、改诗、评诗,值不值得为 Astra 掏钱?各档位的 Astra 权限还在分批放开,下表是 9 月 4 日各家报道的口径,以官方页面为准。

档位月费 · 美元AstraAstra Pro选单里叫 GPT-6 Pro适合谁
Free / Go0 / 低价无给的是 5.6 Luna无偶尔写一首的人
Plus20有限额,用完可买无常写诗、改诗的人
Pro100 / 200有全额每周 50 / 200 条整天用它干活的人
Business标准 / 高级有标准档限量每月 15 / 每周 50 条团队,写诗不是重点
API按量10 / 50每百万词元 输入/输出同价做工具、批量评卷

就格律诗词这一件事,小结四句:偶尔写写的不必订,免费模型加本站的格律检测就够,出律的字反正要靠引擎抓;常写的订 Plus,20 美元拿到的就是本文考的这个 Astra,写诗登顶、评诗第 2;别为诗买 Pro,Astra Pro 判律与普通版并列,每题贵三倍,长处在长任务不在诗;批量评卷走 API 并留重试,每首约 0.044 美元,但本期有五分之一的评卷调用返回空白,而 Kimi K3 评得更准、只要十分之一的钱。预算紧的看 Gemini 3.8 Flash,四轨中上,标价是 Astra 的十三分之一。

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。外界评测与档位数据引自 OpenAI 发布材料以及 VentureBeat、9to5Mac 等公开报道。


查看完整榜单 →