‹返回
观察员摸底
观察员摸底

Union Alpha,智谱最强模型?

2026-09-16 · 二〇二六年九月榜

OpenRouter 当天上架的隐身模型 union-alpha,外界猜它出自智谱;若属实,便是智谱迄今在本榜最强的模型。它以观察员身份考了判律、控律、诗才三卷:判律 85.0、控律 59.2、诗才 78.9,三卷皆高于智谱在榜的 GLM-5.3,诗才一卷显著。身份未证实,本页不作认定,只做摸底记录;不入榜、不占席,榜单不动。

三卷对照

union-alpha
观察员
glm-5.3
传闻同门(未证实)
该榜
当期榜首
判律 TONE·判综合分 85.0
推算 #5
[82.1, 87.3]
83.4
#11
[80.4, 85.8]
88.9
doubao-seed-2.1
错字分 46.6 42.9 70.1
控律 TONE·控控律分 59.2
推算 #3,与前二并列
[52.4, 67.1]
50.7
#10
[44.0, 57.8]
63.9
gpt-6-astra
合律率 100% 100% 100%
诗才 VERSE诗才分 78.9
推算 #2
[76.1, 81.6]
73.8
#3
[71.6, 76.0]
82.9
gpt-6-astra
入评首数 19 20 20

方括号内为该分数的 95% bootstrap 置信区间。名次以区间为准:区间重叠视为统计并列。表中「推算」名次是「若它占一席则列第几」的推算位次,卷面与在榜各席同题同判。

第二列取 GLM-5.3,只因外界传闻这款隐身模型可能出自智谱。传闻未经证实,本页不作认定;这一列请读作「与被猜测的同门旧版的距离」。若揭晓后另有其主,此列作废,届时按该厂在榜席位重排。

诗才卷二十题只收到十九首:有一题七律,它连续三次思考超过五分钟,被接入方的服务端超时掐断,未能交卷。十九首里一首犯孤平,一首在 JSON 之外多写了诗题致引擎无法解析,两首均按规则打七五折计分。

逐类看

判律卷七类判定的 F1,控律卷八类任务的得分。数字越高越好;第四列是该榜榜首在同一类上的数值。

判律union-alphaglm-5.3榜首 doubao-seed-2.1
平仄有误53.562.971.9
用韵10096.6100
孤平70.669.975.4
三平尾83.883.887.3
三仄尾98.498.398.2
失粘90.685.789.6
重字98.486.6100
控律union-alphaglm-5.3榜首 gpt-6-astra
合律100100100
平仄有误908080
用韵9590100
孤平805070
三平尾503055
三仄尾708095
失粘201530
重字100100100

判律的短板很明确:平仄错字的字级定位。它能判断一首诗有没有出律,却常指不准是哪个字,错字分 46.6 在榜内只高于 GLM-5.3。这一弱项与 GPT-6 Astra 同型(错字分 56.1)。其余各类都在第一梯队,失粘一项与榜首持平。

控律卷它写合律诗、按令犯平仄、用韵、孤平三类都在前列,孤平一类 80 分高于榜首;三仄尾 70 分明显落后于榜首的 95。失粘历来是各家最弱的一类,它 20 分,与在榜各席相仿。控律卷每类只有二十首,区间天然偏宽,前六席的区间彼此重叠,名次点估计的几分之差不作数。

它写的诗

诗才卷由十一位在榜模型双盲评分。评委原始均分 81.1,扣除格律与格式罚分后为 78.9。题目与全诗按本榜惯例不公开,以防回流进训练语料;这里只说写法。

评委给分最高的一首七绝拿到 87.0,引擎判完全合律:前两句取一个当代日常物件入手,第三句转出一个动作,结句以景收住,不点破情绪,评委几乎一致给了结句余味的高分。后两句为:

欲唤屏中人转面,炊烟不动燕初飞。

得分次高的一首七律 86.0,写的是高空俯视的城市夜景,颔联一联为:

桥收细火分双线,水截繁灯作两城。
这首在规定的 JSON 之外多写了一行诗题,引擎按格式不合格处理,计分时打了七五折。去掉那行后逐字核验,平仄、用韵、粘对全部合谱。

十九首里七绝均分 80.4,七律 81.9,长篇没有掉队。题材全是现代命题,多数做到了切题实写、结句留白,少见堆砌套语;引擎判出的唯一一处格律问题是一首七律的孤平。

评委怎么看它

既然有「可能是智谱」的传闻,就得查一查智谱在榜的 GLM-5.3 有没有给它高抬贵手。方法是比较每位评委两个偏移:评正式池时比其他评委平均高多少,评它时又高多少。两者的差才是「对它另眼相看」的部分。

评委评正式池偏移评它的偏移差
gpt-6-astra−3.3+3.6+6.9
claude-fable-5.1−9.4−5.0+4.4
deepseek-v4-pro-0813+3.0+5.3+2.3
gemini-3.8-flash+3.4+5.3+1.9
muse-spark-1.2−0.5+0.8+1.2
doubao-seed-2.1−0.0+1.1+1.1
glm-5.3+9.0+9.2+0.3
kimi-k3−1.2−2.5−1.3
hunyuan-hy4-preview−1.3−3.1−1.8
qwen3.8-max+4.9+0.8−4.2
grok-4.6−8.5−15.5−6.9

GLM-5.3 给它的分最高,但 GLM-5.3 评谁都最宽,两个偏移几乎一样,差只有 0.3,看不出护短。真正对它另眼相看的是 GPT-6 Astra,多给了 6.9;最苛刻的是 Grok 4.6,少给了 6.9。去掉 GLM-5.3 后评委均分从 81.1 变为 80.3,结论不变。

按本榜规则,观察员不担任评委:它没有给任何在榜作品打分,诗评榜不受影响。

它慢

这是三卷考下来最显眼的工程特征。它默认深度思考,一道判律题常要想几分钟,写一首七律更久。接入方对单次请求有五分钟的服务端上限,超过即掐断:

白卷不是不会写,补上的答卷质量与首轮无异。但若正式接入,这个速度意味着用户等待和超时都要另作安排。

外界传闻,与我们的看法

怎么测的

完整方法论见榜单设计原则。外部信息来源:OpenRouter 模型页、OpenRouter 发布推文、OrcaRouter 分析、Crypto Briefing 报道。


查看完整榜单 →