Muse Spark 1.3 复测:编码榜上大跃进,诗词榜上全线退——判律明显退步、诗才掉一名、诗评垫底,Meta 席维持 1.2
2026-09-04 · 二〇二六年九月榜
Meta 9 月 2 日发布 Muse Spark 1.3,编码与长上下文基准大步向前,外界给的评价是「便宜的前沿」。榜单规则不看发布会,同厂新版一律四榜同卷复测:读诗、写诗、评诗,1.3 对 1.2,一项一项比。结果是判律与诗才明显退步、诗评垫底、控律略升不显著——Meta 席维持 1.2,不换。这是榜单第一次让新版落选,落选的理由也得写清楚。
外界怎么说:一次「便宜的前沿」发布
Meta 在 9 月 2 日放出 Muse Spark 1.3,口号是「几乎便宜到不必计量的前沿性能」,主打编码与智能体:DeepSWE 1.1 得 75.4(超过 Claude Opus 5 的 74.0,前代 1.2 是 55.0),Terminal-Bench 2.1 得 88.8(与 GPT-5.6 Sol 并列),长上下文 MRCR 512K 到 1M 段得 98.1(GPT-5.6 Sol 73.8);工具调用比 1.2 少两成,词元少四分之一。Artificial Analysis 给它的智能指数是 61,与 GPT-5.6 Sol、Claude Opus 5 的高档并列,而且是这一档里单任务成本最低的。标价不变,输入 1.25、输出 4.25 美元每百万词元。
媒体挑出的毛病也不少。头一条,拿来跑分的不是能用的那个:图表上的「max」档还在做安全测试,只对合作方开放,人人能调的是 xhigh 档,指数 61 而非 62;和前代比时又是 max 对 xhigh,不同档位混着比。第二条,智能体那半张表全输了:六项智能体基准(GDPval、JobBench、OSWorld 2.0 等)全部落后于 Opus 5 或 GPT-5.6 Sol,多数报道没提。第三条,「贡献者」价签的代价:便宜 92% 的那一档要授权 Meta 拿你的提示词和输出去训练。第四条,话反而更多了:Artificial Analysis 实测它在同一套评测上输出 1 亿词元,同类中位数是 7 千 1 百万,与 Meta「少 25%」的说法相反;按任务算的成本也从 1.2 的 0.40 美元涨到 0.55 美元。另外,8 月许诺的 1.2 开放权重到 9 月仍是「即将」。
这些评测没有一项碰过中文,更没有一项碰过格律。我们只问一件事:一个在编码和长上下文上大步前进的版本,读诗、写诗、评诗有没有跟着前进?按榜单规则,同厂新版一律做升级复测,四榜同卷,Muse Spark 1.3 对 Muse Spark 1.2。
四榜总览:新版、同门旧版、该榜榜首
对照口径固定:新版|同门旧版|该榜当期榜首。升降只按 95% 置信区间判——区间重叠一律写「统计并列」,两版同题配对重采样的差值区间不含零才写「明显」。方括号是 95% 置信区间。
| Muse Spark 1.3 | Muse Spark 1.29-2 发布版 | 该榜榜首 | |
|---|---|---|---|
| 判律榜综合分 · 七类判定 F1 明显退步 | 80.1#11 · [77.0, 82.7] 错字分 57.7 | 83.8#9 · [80.7, 86.2] 错字分 61.8 | 88.9Doubao 2.1 #1 错字分 70.1 |
| 控律榜控律分 · 实证权 统计并列 | 58.6#2 · [52.0, 65.8] | 55.6#4 · [46.8, 64.6] | 61.1Gemini 3.8 Flash #1 [54.1, 68.6] |
| 诗才榜诗才分 · 五维双盲互评 明显退步 | 52.2#10 · [49.5, 54.7] 19 首 | 56.1#9 · [53.0, 59.4] 19 首 | 75.2Fable 5.1 #1 |
| 诗评榜与共识偏差 · 越小越准 明显退步 | 11.54#11 · 去偏移 5.30 | 5.59#3 · [5.03, 6.17] 去偏移 5.53 | 4.43Kimi K3 #1 |
判律:读诗的本事退了,七类里五类不如前代
判律榜考的是「读」:给一首近体诗,模型要说出它犯了哪几类病、错在哪个字。综合分是七类判定的 F1 宏平均;错字分单独量能不能把平仄错字指到位。
80.1 对 83.8,从第 9 掉到第 11,垫底。两个区间虽有重叠,但这是同一张卷,可以做配对比较:231 道同题上新版比旧版低 3.5 分,重采样一千次的差值区间是 [−5.6, −1.6],不含零——明显退步。错字分 57.7 对 61.8,也退。
七类判定 F1(判律榜分项)
| Spark 1.3 | Spark 1.2 | 该类最高11 席 | |
|---|---|---|---|
| 平仄有误 | 57.6 | 55.8 | 76.7Fable 5.1 |
| 用韵 | 80.0全场最低 | 87.5 | 100多席 |
| 孤平 | 70.7 | 76.3 | 77.9DeepSeek |
| 三平尾 | 81.1 | 81.6 | 93.1Qwen3.8 |
| 三仄尾 | 98.4 | 98.4 | 98.4多席 |
| 失粘 | 80.6 | 87.0 | 90.6Fable 5.1 |
| 重字 | 92.3 | 100 | 100多席 |
退在哪里很集中:用韵 87.5 → 80.0,成了全场最低——押没押韵,是七类里最机械的一类,多数席位拿满分;重字 100 → 92.3,一首诗里有没有重复用字,旧版一个不漏,新版漏了;孤平、失粘各退六七分。唯一往上的是平仄有误(55.8 → 57.6),一两分,噪声。它每题平均花 9 408 个词元思考,比旧版的 8 064 还多 17%。想得久了,判得反而差了。
控律:从第 4 到第 2,可惜全榜谁也称不上显著
控律榜考的是「写」的另一面:命模型按令作七绝——要么完全合律,要么只犯指定的某一种病、其余全对。规则引擎逐字核验,三档评分、难度加权。这是四榜里最难的一张卷。
八项任务达成率 %(控律榜分项)
| Spark 1.3 | Spark 1.2 | 该项最高11 席 | |
|---|---|---|---|
| 合律 | 95 | 95 | 100多席 |
| 只犯平仄 | 90并列最高 | 75 | 90并列 Kimi、3.8 Flash |
| 只犯用韵 | 95 | 65 | 100Fable 5.1、3.8 Flash |
| 只犯孤平 | 65 | 45 | 80Kimi |
| 只犯三平尾 | 70 | 55 | 753.8 Flash |
| 只犯三仄尾 | 75 | 57 | 95多席 |
| 只犯失粘 | 15 | 35原全场最高 | 25Grok、DeepSeek |
| 只犯重字 | 100 | 100 | 100多席 |
58.6 对 55.6,第 4 升到第 2,是四榜里唯一往上的。但同任务 160 首配对,差值 +3.0,区间 [−9.2, +14.5],跨零;这张榜从第 1 到第 11 的区间几乎全部重叠,谁也不能称显著。分项看,五项「精确犯病」都涨了,只犯用韵 65 → 95、只犯孤平 45 → 65 涨得最多;掉的只有一项,只犯失粘 35 → 15——旧版这一项是全场最高,新版跌到中下。失粘是全场公认最难控的一种病,没有一家过 35。
诗才:从第 9 到第 10,绝句律诗都退
诗才榜是 20 个现代命题,每题七绝、七律各一首,全席双盲互评,五维打分(立意、意境、语言、章法、余味),去掉作者本人和同门评委的分。题目是当期机密,这里不列。
52.2 对 56.1,两个区间不相交(新版上沿 54.7,旧版下沿 53.0),明显退步。绝句均 55.4 对 58.5,律诗均 48.5 对 53.4,两种体裁都退,律诗退得更多。19 首有效,1 首交了白卷。第 10 名之下只剩混元,而榜首 Fable 5.1 是 75.2,差了 23 分——Meta 席在这张榜上从来不靠前,这次更靠后了。
整卷不公开,只摘评分最高的一首(去己去同门共识 67.0)里的一联:
上句把一件旧物的去向写成一夜赶工的牵挂,下句把季节的转换接过来收尾,意思是通的,词也是熟的——「雪化作春光」这样的结句,评委给的「出新」分普遍不高。它的通病是稳而旧:格律上不出错,意象上也不出人意料,五维里「立意」「余味」两项多在 50 分上下。
诗评:看出了抄袭,却给了 72 分
诗评榜让每一席给所有作品打分,与「去掉自己和同门后的共识分」比,平均绝对偏差越小越准。1.2 在发布版是第 3(5.59),仅次于 Kimi、Doubao;1.3 是 11.54,第 11,垫底。
偏差可以拆成「尺度」和「眼力」两半。
| Spark 1.3顶替后池 | Spark 1.2发布版池 | Kimi K3榜首 | |
|---|---|---|---|
| 平均绝对偏差与共识,越小越准 | 11.54#11 | 5.59#3 | 4.43#1 |
| 尺度偏移负=偏严,正=偏宽 | −11.06 | −1.11 | −0.56 |
| 去偏移偏差越小=眼力越好 | 5.30 | 5.53 | 4.45 |
| 秩相关 ρ | 0.779全榜最低 | 0.811 | 0.863 |
| 低于共识打分占比 | 95%191 份 | — | 61% |
1.3 的 11.54 几乎全是尺度:它给每一首诗的分平均比共识低 11 分,191 份打分里 95% 低于共识,是全榜最严的评委,比上一期以严著称的 Fable 5.1 还要严。把尺度扣掉,去偏移偏差 5.30,和旧版 5.53 相当——眼力没退,只是把尺子往下挪了一格。不过排序一致性 0.779 是全榜最低,说明它心里那把尺不光是偏,还有些晃。
最能说明问题的是它评那首抄袭之作的方式。上一期写过:某席交了一首把唐人崔护《题都城南庄》原样搬来的七绝,评委席分成两半,Doubao 与 Gemini 3.8 Flash 给 0 分,Kimi、GPT-5.6 Sol 给了 58 到 66 分。这一次 1.3 的评语只有一句:
全文照抄崔护《题都城南庄》,与标题完全游离,原作之美仍在,蹈袭从重。
它看出来了,「蹈袭」一项也顶格扣了。然后意境给 9、语言给 8.5、章法给 9、余味给 9.5,合计 72 分——共识只有 46,这成了它全卷最宽的一笔。旧版 1.2 给这首 63.75,同样没扣到底。我们的评分标准写明蹈袭一票否决,「原作之美仍在」这句话本就不该出现在评语里:抄来的美不是作者的。一个对别的诗平均严 11 分的评委,对一首抄来的诗宽了 26 分,说明它记得规则,没有照规则打分。
它最严的一笔(−32)给了一首七绝,共识 76.6,它给 44.25,五维全部压在 40 到 50 之间,没有说出具体哪一句不好。
成本:想得更久,账单更贵
| Spark 1.3 | Spark 1.2 | 3.8 Flash参照 | |
|---|---|---|---|
| 判律均价/题美元 | 0.039231 题 | 0.033234 题 | 0.025230 题 |
| 判律均词元/题 | 9 408 | 8 064 | 6 851 |
| 诗评均价/份 | 0.0127191 份 | 0.0092265 份 | 0.0054190 份 |
| 标价每百万词元 输入/输出 | $1.25 / $4.25 | $1.25 / $4.25 | $0.75 / $3.75 |
标价一分没变,账单却贵了:判律每题 0.033 → 0.039 美元,涨 18%,诗评每份涨 38%,全是思考变长带来的。这和 Artificial Analysis 在别的评测上的观察一致——Meta 说词元少了 25%,实测是多了。四轨复测合计约 16 美元。
结论:不换席
四榜里两榜明显退步(判律、诗才),一榜垫底(诗评),一榜统计并列(控律)。按「同厂多线择优,取本榜综合分最高的一款」的规则,Meta 席维持 Muse Spark 1.2,1.3 的答卷存档、不上榜。这是榜单第一次让新版落选,规则对所有厂商一样,落选也照写。
压成三句话:读诗退了(判律 83.8 → 80.1,用韵、重字两类最机械的判定反而漏得多);写诗退了(诗才 56.1 → 52.2,绝句律诗都退;控律略升但不显著);评诗严了(每首平均压低 11 分,眼力尚在,可对抄袭之作却下不去手)。
这和外界的评测对得上:1.3 的进步集中在编码、终端和长上下文,Meta 自己也没把语言与创作列入卖点。一个专为智能体调过的版本,在格律诗词上退了,前沿原来是分方向的。Meta 下一版出来,我们再考一次;1.2 的开放权重要是真放出来,另开一席作开源参照。
方法:判律/控律由确定性规则引擎逐字核验;诗才/诗评为全席双盲互评、去己去同门共识。本期口径与完整榜面见 声律榜、诗才榜、诗评榜。本文为不换席的复测记录,榜面不动;1.3 已列入退役席,答卷存档。外界评测数据引自 Meta 发布材料、VentureBeat 与 Artificial Analysis 的公开报道。