Union Alpha,智谱最强模型?
2026-09-16 · 二〇二六年九月榜
OpenRouter 当天上架的隐身模型 union-alpha,外界猜它出自智谱;若属实,便是智谱迄今在本榜最强的模型。它以观察员身份考了判律、控律、诗才三卷:判律 85.0、控律 59.2、诗才 78.9,三卷皆高于智谱在榜的 GLM-5.3,诗才一卷显著。身份未证实,本页不作认定,只做摸底记录;不入榜、不占席,榜单不动。
三卷对照
| union-alpha 观察员 |
glm-5.3 传闻同门(未证实) |
该榜 当期榜首 |
|
|---|---|---|---|
| 判律 TONE·判综合分 | 85.0[82.1, 87.3] | 83.4[80.4, 85.8] | 88.9 |
| 错字分 | 46.6 | 42.9 | 70.1 |
| 控律 TONE·控控律分 | 59.2[52.4, 67.1] | 50.7[44.0, 57.8] | 63.9 |
| 合律率 | 100% | 100% | 100% |
| 诗才 VERSE诗才分 | 78.9[76.1, 81.6] | 73.8[71.6, 76.0] | 82.9 |
| 入评首数 | 19 | 20 | 20 |
方括号内为该分数的 95% bootstrap 置信区间。名次以区间为准:区间重叠视为统计并列。表中「推算」名次是「若它占一席则列第几」的推算位次,卷面与在榜各席同题同判。
第二列取 GLM-5.3,只因外界传闻这款隐身模型可能出自智谱。传闻未经证实,本页不作认定;这一列请读作「与被猜测的同门旧版的距离」。若揭晓后另有其主,此列作废,届时按该厂在榜席位重排。
诗才卷二十题只收到十九首:有一题七律,它连续三次思考超过五分钟,被接入方的服务端超时掐断,未能交卷。十九首里一首犯孤平,一首在 JSON 之外多写了诗题致引擎无法解析,两首均按规则打七五折计分。
逐类看
判律卷七类判定的 F1,控律卷八类任务的得分。数字越高越好;第四列是该榜榜首在同一类上的数值。
| 判律 | union-alpha | glm-5.3 | 榜首 doubao-seed-2.1 |
|---|---|---|---|
| 平仄有误 | 53.5 | 62.9 | 71.9 |
| 用韵 | 100 | 96.6 | 100 |
| 孤平 | 70.6 | 69.9 | 75.4 |
| 三平尾 | 83.8 | 83.8 | 87.3 |
| 三仄尾 | 98.4 | 98.3 | 98.2 |
| 失粘 | 90.6 | 85.7 | 89.6 |
| 重字 | 98.4 | 86.6 | 100 |
| 控律 | union-alpha | glm-5.3 | 榜首 gpt-6-astra |
|---|---|---|---|
| 合律 | 100 | 100 | 100 |
| 平仄有误 | 90 | 80 | 80 |
| 用韵 | 95 | 90 | 100 |
| 孤平 | 80 | 50 | 70 |
| 三平尾 | 50 | 30 | 55 |
| 三仄尾 | 70 | 80 | 95 |
| 失粘 | 20 | 15 | 30 |
| 重字 | 100 | 100 | 100 |
判律的短板很明确:平仄错字的字级定位。它能判断一首诗有没有出律,却常指不准是哪个字,错字分 46.6 在榜内只高于 GLM-5.3。这一弱项与 GPT-6 Astra 同型(错字分 56.1)。其余各类都在第一梯队,失粘一项与榜首持平。
控律卷它写合律诗、按令犯平仄、用韵、孤平三类都在前列,孤平一类 80 分高于榜首;三仄尾 70 分明显落后于榜首的 95。失粘历来是各家最弱的一类,它 20 分,与在榜各席相仿。控律卷每类只有二十首,区间天然偏宽,前六席的区间彼此重叠,名次点估计的几分之差不作数。
它写的诗
诗才卷由十一位在榜模型双盲评分。评委原始均分 81.1,扣除格律与格式罚分后为 78.9。题目与全诗按本榜惯例不公开,以防回流进训练语料;这里只说写法。
评委给分最高的一首七绝拿到 87.0,引擎判完全合律:前两句取一个当代日常物件入手,第三句转出一个动作,结句以景收住,不点破情绪,评委几乎一致给了结句余味的高分。后两句为:
得分次高的一首七律 86.0,写的是高空俯视的城市夜景,颔联一联为:
十九首里七绝均分 80.4,七律 81.9,长篇没有掉队。题材全是现代命题,多数做到了切题实写、结句留白,少见堆砌套语;引擎判出的唯一一处格律问题是一首七律的孤平。
评委怎么看它
既然有「可能是智谱」的传闻,就得查一查智谱在榜的 GLM-5.3 有没有给它高抬贵手。方法是比较每位评委两个偏移:评正式池时比其他评委平均高多少,评它时又高多少。两者的差才是「对它另眼相看」的部分。
| 评委 | 评正式池偏移 | 评它的偏移 | 差 |
|---|---|---|---|
| gpt-6-astra | −3.3 | +3.6 | +6.9 |
| claude-fable-5.1 | −9.4 | −5.0 | +4.4 |
| deepseek-v4-pro-0813 | +3.0 | +5.3 | +2.3 |
| gemini-3.8-flash | +3.4 | +5.3 | +1.9 |
| muse-spark-1.2 | −0.5 | +0.8 | +1.2 |
| doubao-seed-2.1 | −0.0 | +1.1 | +1.1 |
| glm-5.3 | +9.0 | +9.2 | +0.3 |
| kimi-k3 | −1.2 | −2.5 | −1.3 |
| hunyuan-hy4-preview | −1.3 | −3.1 | −1.8 |
| qwen3.8-max | +4.9 | +0.8 | −4.2 |
| grok-4.6 | −8.5 | −15.5 | −6.9 |
GLM-5.3 给它的分最高,但 GLM-5.3 评谁都最宽,两个偏移几乎一样,差只有 0.3,看不出护短。真正对它另眼相看的是 GPT-6 Astra,多给了 6.9;最苛刻的是 Grok 4.6,少给了 6.9。去掉 GLM-5.3 后评委均分从 81.1 变为 80.3,结论不变。
按本榜规则,观察员不担任评委:它没有给任何在榜作品打分,诗评榜不受影响。
它慢
这是三卷考下来最显眼的工程特征。它默认深度思考,一道判律题常要想几分钟,写一首七律更久。接入方对单次请求有五分钟的服务端上限,超过即掐断:
- 判律:首轮 236 题交白卷 23 题,补跑两轮后剩 1 题始终答不出。
- 控律:首轮 160 首交白卷 45 首,集中在合律、用韵、平仄三类,恰是需要通盘推演的题;放宽客户端等待后全部补齐。
- 诗才:二十题首轮只交 15 首,改用流式接收补到 19 首,最后一首七律三次都超过五分钟。
白卷不是不会写,补上的答卷质量与首轮无异。但若正式接入,这个速度意味着用户等待和超时都要另作安排。
外界传闻,与我们的看法
- 公开信息。2026 年 9 月 16 日上架 OpenRouter,标识 stealth/union-alpha,预览期免费;上下文 262144,支持图文输入、文字输出、工具调用。OpenRouter 称其为「匿名第三方提供的隐身模型」,只转发不开发;有报道称它与 OpenCode 合作推出。数据政策写明「提示与回复可能被提供方保留,不用于训练」。
- 身份猜测。社区提到智谱与月之暗面,均无指纹证据。先例是 Ox Alpha:8 月 20 日同一方式上架,六天后揭晓为智谱 GLM-5.3-Flash。当时的猜测「猜对了公司,猜错了型号」。
- 一个误读。同日 Cloudflare 宣布其 AI 网关首次上架隐身模型,即 Union Alpha,中文转述常译成「Cloudflare 的首款隐身模型」。Cloudflare 文档将其标为第三方模型,网关只是转发到匿名提供方,这不是揭晓。
- 我们的观察。三卷全面强于 GLM-5.3:判律高 1.6,控律高 8.5,诗才高 5.1。判律短板与 GPT-6 Astra 同型,评委行为上没有同门信号。这些都不足以指认任何一家。
- 榜单不动。本页只是摸底记录。待开发方揭晓,若属在榜厂商,按「同厂多线择优」规则重测定席;若是新厂,按新席入场规则处理。在此之前,各榜名次维持原状。
怎么测的
- 同题同卷。三卷沿用本期原卷,与在榜各席同题同判,分数直接可比。
- 裁判是规则。判律、控律全部由确定性规则引擎逐字核验;诗才由在榜模型双盲互评,剔除自评与同门。
- 观察员规则。不占席、不入榜、不当评委、不参与任何权重计算;答卷原样留档,揭晓后可直接复用。
- 调用口径。与在榜各席一致,深度思考开到最强;写诗、判律的提示词与在榜各席逐字相同。
- 同一把尺。控律卷按本期榜单发布时(9 月 4 日)的引擎版本判定,与榜上各席同一口径;引擎后续的修订将随下期榜单一并生效,届时各席分数同步重算。
完整方法论见榜单设计原则。外部信息来源:OpenRouter 模型页、OpenRouter 发布推文、OrcaRouter 分析、Crypto Briefing 报道。