‹返回
升级复测
升级复测

Muse Spark 1.3 复测:编码榜上大跃进,诗词榜上全线退——判律明显退步、诗才掉一名、诗评垫底,Meta 席维持 1.2

2026-09-04 · 二〇二六年九月榜

Meta 9 月 2 日发布 Muse Spark 1.3,编码与长上下文基准大步向前,外界给的评价是「便宜的前沿」。榜单规则不看发布会,同厂新版一律四榜同卷复测:读诗、写诗、评诗,1.3 对 1.2,一项一项比。结果是判律与诗才明显退步、诗评垫底、控律略升不显著——Meta 席维持 1.2,不换。这是榜单第一次让新版落选,落选的理由也得写清楚。

外界怎么说:一次「便宜的前沿」发布

Meta 在 9 月 2 日放出 Muse Spark 1.3,口号是「几乎便宜到不必计量的前沿性能」,主打编码与智能体:DeepSWE 1.1 得 75.4(超过 Claude Opus 5 的 74.0,前代 1.2 是 55.0),Terminal-Bench 2.1 得 88.8(与 GPT-5.6 Sol 并列),长上下文 MRCR 512K 到 1M 段得 98.1(GPT-5.6 Sol 73.8);工具调用比 1.2 少两成,词元少四分之一。Artificial Analysis 给它的智能指数是 61,与 GPT-5.6 Sol、Claude Opus 5 的高档并列,而且是这一档里单任务成本最低的。标价不变,输入 1.25、输出 4.25 美元每百万词元。

媒体挑出的毛病也不少。头一条,拿来跑分的不是能用的那个:图表上的「max」档还在做安全测试,只对合作方开放,人人能调的是 xhigh 档,指数 61 而非 62;和前代比时又是 max 对 xhigh,不同档位混着比。第二条,智能体那半张表全输了:六项智能体基准(GDPval、JobBench、OSWorld 2.0 等)全部落后于 Opus 5 或 GPT-5.6 Sol,多数报道没提。第三条,「贡献者」价签的代价:便宜 92% 的那一档要授权 Meta 拿你的提示词和输出去训练。第四条,话反而更多了:Artificial Analysis 实测它在同一套评测上输出 1 亿词元,同类中位数是 7 千 1 百万,与 Meta「少 25%」的说法相反;按任务算的成本也从 1.2 的 0.40 美元涨到 0.55 美元。另外,8 月许诺的 1.2 开放权重到 9 月仍是「即将」。

这些评测没有一项碰过中文,更没有一项碰过格律。我们只问一件事:一个在编码和长上下文上大步前进的版本,读诗、写诗、评诗有没有跟着前进?按榜单规则,同厂新版一律做升级复测,四榜同卷,Muse Spark 1.3 对 Muse Spark 1.2。

#11 ↓2判律榜 综合 80.1
#2 ↑2控律榜 58.6
#10 ↓1诗才榜 52.2
#11 ↓8诗评榜 偏差 11.54

四榜总览:新版、同门旧版、该榜榜首

对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,两版同题配对重采样的差值区间不含零才写「明显」。方括号是 95% 置信区间。

Muse Spark 1.3Muse Spark 1.29-2 发布版该榜榜首
判律榜综合分 · 七类判定 F1
明显退步
80.1#11 · [77.0, 82.7]
错字分 57.7
83.8#9 · [80.7, 86.2]
错字分 61.8
88.9Doubao 2.1 #1
错字分 70.1
控律榜控律分 · 实证权
统计并列
58.6#2 · [52.0, 65.8]55.6#4 · [46.8, 64.6]61.1Gemini 3.8 Flash #1
[54.1, 68.6]
诗才榜诗才分 · 五维双盲互评
明显退步
52.2#10 · [49.5, 54.7]
19 首
56.1#9 · [53.0, 59.4]
19 首
75.2Fable 5.1 #1
诗评榜与共识偏差 · 越小越准
明显退步
11.54#11 · 去偏移 5.305.59#3 · [5.03, 6.17]
去偏移 5.53
4.43Kimi K3 #1
口径说明。旧版取 2026-09-02 发布版榜面(11 席)。新版是让 1.3 顶替 1.2 那一席后的重算(仍 11 席)。同门回避照旧:1.3 与 1.2 互不判题、互不打分,算共识时也剔除,所以 1.3 判律有效卷 231 题、诗评样本 191 份,少掉的正是 1.2 写的那些。判律、控律由规则引擎判分,各席互不影响;诗才、诗评是互评榜,评委席一变别家的分也会动零点几,「榜首」取重算池的榜首。题目与答卷按榜单纪律不公开。

判律:读诗的本事退了,七类里五类不如前代

判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。

80.1 对 83.8,从第 9 掉到第 11,垫底。两个区间虽有重叠,但这是同一张卷,可以做配对比较:231 道同题上新版比旧版低 3.5 分,重采样一千次的差值区间是 [−5.6, −1.6],不含零——明显退步。错字分 57.7 对 61.8,也退。

七类判定 F1(判律榜分项)

Spark 1.3Spark 1.2该类最高11 席
平仄有误57.655.876.7Fable 5.1
用韵80.0全场最低87.5100多席
孤平70.776.377.9DeepSeek
三平尾81.181.693.1Qwen3.8
三仄尾98.498.498.4多席
失粘80.687.090.6Fable 5.1
重字92.3100100多席

退在哪里很集中:用韵 87.5 → 80.0,成了全场最低——押没押韵,是七类里最机械的一类,多数席位拿满分;重字 100 → 92.3,一首诗里有没有重复用字,旧版一个不漏,新版漏了;孤平、失粘各退六七分。唯一往上的是平仄有误(55.8 → 57.6),一两分,噪声。它每题平均花 9 408 个词元思考,比旧版的 8 064 还多 17%。想得久了,判得反而差了。

控律:从第 4 到第 2,可惜全榜谁也称不上显著

控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷。

八项任务达成率 %(控律榜分项)

Spark 1.3Spark 1.2该项最高11 席
合律9595100多席
只犯平仄90并列最高7590并列 Kimi、3.8 Flash
只犯用韵9565100Fable 5.1、3.8 Flash
只犯孤平654580Kimi
只犯三平尾7055753.8 Flash
只犯三仄尾755795多席
只犯失粘1535原全场最高25Grok、DeepSeek
只犯重字100100100多席

58.6 对 55.6,第 4 升到第 2,是四榜里唯一往上的。但同任务 160 首配对,差值 +3.0,区间 [−9.2, +14.5],跨零;这张榜从第 1 到第 11 的区间几乎全部重叠,谁也不能称显著。分项看,五项「精确犯病」都涨了,只犯用韵 65 → 95、只犯孤平 45 → 65 涨得最多;掉的只有一项,只犯失粘 35 → 15——旧版这一项是全场最高,新版跌到中下。失粘是全场公认最难控的一种病,没有一家过 35。

诗才:从第 9 到第 10,绝句律诗都退

诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。

52.2 对 56.1,两个区间不相交(新版上沿 54.7,旧版下沿 53.0),明显退步。绝句均 55.4 对 58.5,律诗均 48.5 对 53.4,两种体裁都退,律诗退得更多。19 首有效,1 首交了白卷。第 10 名之下只剩混元,而榜首 Fable 5.1 是 75.2,差了 23 分——Meta 席在这张榜上从来不靠前,这次更靠后了。

整卷不公开,只摘评分最高的一首(去己去同门共识 67.0)里的一联:

破絮重缝连夜寄,明朝雪化作春光。Muse Spark 1.3 · 七绝 · 该首 67.0

上句把一件旧物的去向写成一夜赶工的牵挂,下句把季节的转换接过来收尾,意思是通的,词也是熟的——「雪化作春光」这样的结句,评委给的「出新」分普遍不高。它的通病是稳而旧:格律上不出错,意象上也不出人意料,五维里「立意」「余味」两项多在 50 分上下。

诗评:看出了抄袭,却给了 72 分

诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。1.2 在发布版是第 3(5.59),仅次于 Kimi、Doubao;1.3 是 11.54,第 11,垫底。

偏差可以拆成「尺度」和「眼力」两半。

Spark 1.3顶替后池Spark 1.2发布版池Kimi K3榜首
平均绝对偏差与共识,越小越准11.54#115.59#34.43#1
尺度偏移负=偏严,正=偏宽−11.06−1.11−0.56
去偏移偏差越小=眼力越好5.305.534.45
秩相关 ρ0.779全榜最低0.8110.863
低于共识打分占比95%191 份—61%

1.3 的 11.54 几乎全是尺度:它给每一首诗的分平均比共识低 11 分,191 份打分里 95% 低于共识,是全榜最严的评委,比上一期以严著称的 Fable 5.1 还要严。把尺度扣掉,去偏移偏差 5.30,和旧版 5.53 相当——眼力没退,只是把尺子往下挪了一格。不过排序一致性 0.779 是全榜最低,说明它心里那把尺不光是偏,还有些晃。

最能说明问题的是它评那首抄袭之作的方式。上一期写过:某席交了一首把唐人崔护《题都城南庄》原样搬来的七绝,评委席分成两半,Doubao 与 Gemini 3.8 Flash 给 0 分,Kimi、GPT-5.6 Sol 给了 58 到 66 分。这一次 1.3 的评语只有一句:

全文照抄崔护《题都城南庄》,与标题完全游离,原作之美仍在,蹈袭从重。

它看出来了,「蹈袭」一项也顶格扣了。然后意境给 9、语言给 8.5、章法给 9、余味给 9.5,合计 72 分——共识只有 46,这成了它全卷最宽的一笔。旧版 1.2 给这首 63.75,同样没扣到底。我们的评分标准写明蹈袭一票否决,「原作之美仍在」这句话本就不该出现在评语里:抄来的美不是作者的。一个对别的诗平均严 11 分的评委,对一首抄来的诗宽了 26 分,说明它记得规则,没有照规则打分。

它最严的一笔(−32)给了一首七绝,共识 76.6,它给 44.25,五维全部压在 40 到 50 之间,没有说出具体哪一句不好。

成本:想得更久,账单更贵

Spark 1.3Spark 1.23.8 Flash参照
判律均价/题美元0.039231 题0.033234 题0.025230 题
判律均词元/题9 4088 0646 851
诗评均价/份0.0127191 份0.0092265 份0.0054190 份
标价每百万词元 输入/输出$1.25 / $4.25$1.25 / $4.25$0.75 / $3.75

标价一分没变,账单却贵了:判律每题 0.033 → 0.039 美元,涨 18%,诗评每份涨 38%,全是思考变长带来的。这和 Artificial Analysis 在别的评测上的观察一致——Meta 说词元少了 25%,实测是多了。四轨复测合计约 16 美元。

结论:不换席

四榜里两榜明显退步(判律、诗才),一榜垫底(诗评),一榜统计并列(控律)。按「同厂多线择优,取本榜综合分最高的一款」的规则,Meta 席维持 Muse Spark 1.2,1.3 的答卷存档、不上榜。这是榜单第一次让新版落选,规则对所有厂商一样,落选也照写。

压成三句话:读诗退了(判律 83.8 → 80.1,用韵、重字两类最机械的判定反而漏得多);写诗退了(诗才 56.1 → 52.2,绝句律诗都退;控律略升但不显著);评诗严了(每首平均压低 11 分,眼力尚在,可对抄袭之作却下不去手)。

这和外界的评测对得上:1.3 的进步集中在编码、终端和长上下文,Meta 自己也没把语言与创作列入卖点。一个专为智能体调过的版本,在格律诗词上退了,前沿原来是分方向的。Meta 下一版出来,我们再考一次;1.2 的开放权重要是真放出来,另开一席作开源参照。

方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。本文为不换席的复测记录,榜面不动;1.3 已列入退役席,答卷存档。外界评测数据引自 Meta 发布材料、VentureBeat 与 Artificial Analysis 的公开报道。


查看完整榜单 →