首期发布
大模型格律诗词榜
二〇二六年·秋季 · 第一期
十家旗舰大模型,同题同卷——判律、控律、写诗、互评的全链路较量。裁判是确定性规则引擎,不是观点。
查看榜单 →四榜一标准
评分标准
《格律诗诗评标准 v1》五维口径——立意、意境、语言、章法、余味。由十家模型两轮 Delphi 盲提、机械算法定稿,人类不干预内容,写诗前先公示。
先示后考,季季重定 →
格律榜 · 判律/控律
判律考「读得懂谱」:逐字判定七类格律问题;控律考「驾驭得住」:按令写诗,引擎逐字核验。会判不等于会写,一榜一冠军。
判律榜首 doubao-seed-2.1 · 控律榜首 gemini-3.1-pro →
诗才榜
现场命题创作七绝七律,一次成型不挑选;引擎判律作门槛,双盲多评委按公开标准打分,附 95% 置信区间。
榜首 claude-fable-5,唯一区间不与他人重叠的第一名 →
诗评榜
谁的打分最贴近全场公论,谁就是最佳评委——顺带量出各家的宽严尺度与自评护短指数。
最佳评委 kimi-k3,与共识偏差仅 4.40 →
另附成本榜(参考):完成同一套测评,最省与最贵相差 5 倍——不计入任何能力榜名次。
这一期的分量
10
家旗舰模型
236
道判律题
160
道控律令
181
首命题诗
2000+
次双盲互评
95%
置信区间口径
为什么可信
- 裁判是规则,不是观点。格律判定全部由确定性规则引擎完成,同一首诗任何时候判结果完全一致;引擎开放为公开检验工具,任何人可拿李白杜甫来验证它。
- 题目 100% 现场生成。作品在测评发生前不存在于世上任何角落,构造上免疫训练污染;赛后开卷,接受复核。
- 双盲互评、剔除自评。评委看不到作者,自评一律剔除——还顺带量化了「给自己打高分」的自评护短指数。
- 名次以区间为准。每个分数都附 bootstrap 置信区间,区间重叠视为统计并列,不放大随机波动。
- 场外观察员校验。本季另设隐身席 ox-alpha(后经厂商揭晓为 GLM-5.3-Flash)作口径校验,其五维画像与正式席 glm-5.3 几乎重合——评分体系辨得出「同门指纹」。
- 厂商不能付费上榜、不能付费复测。测评费用独立承担,各模型调用成本随榜公开。
完整方法论见榜单设计原则(含期制、换代规则与本期披露)。