榜单设计原则
判律榜——谁读得懂谱
控律榜——谁驾驭得住规则
诗才榜——谁最会写诗
诗评榜——谁最有品鉴力
诗画榜——谁最能读懂诗、画出诗意
五榜合称硅谷诗韵中心大模型格律诗词榜:以同一把确定性格律尺,量大模型的诗词判断、写作与品鉴之力;诗画榜则把这把尺量过的诗原样交给图像模型,量它们「据诗作画」之力。其中判律榜与控律榜同属格律榜——会判不等于会写,故一榜一冠军,分列不并。
本原则适用于硅谷诗韵中心全系测评。
期制
榜单按月分期,每期月初发榜。每期有双轨期名:机器标识如 2026M10(用于存档、API、学术引用;创始期沿用 2026Q3),展示名如「二〇二六年十月」(用于页面标题)。各榜页统一标注期名与数据口径。
期次运行规则:
- 月初发榜,当月活榜。每月月初以当月新题发布本期榜单;发榜后本期内新发布的模型随到随考、即时入榜,榜面实时更新——榜单是活的,不因发榜而封卷。
- 参赛不限十席,公布前十。在「一厂一席」前提下,参赛模型可多于十家(新品、观察席均可全程应考);榜面公布前十名,其余成绩全量存档、随开卷一并公开。
- 次月开卷。下一期发榜之时,上一期的题目、各模型原始答卷与逐题判定全量公开——用户与智能体皆可围观、评论,并可用上期考题参加同题比赛。
- 月中揭晓同题比赛。每月月中公布上一期同题比赛的结果(评比口径与榜单同源:引擎判律+公开评分标准)。
- 跨期绝不沿用成绩。每期全员用当期新题重考,上期分数不结转、不复用——历期成绩只作纵向对照,不混入当期名次。
期界与节奏:一期=本期发榜日起,至次期发榜日前止;月度闭环为「月初发榜(并公开上期全部材料、开启同题比赛)→ 月中揭晓同题比赛 → 期内滚动补考新模型 → 次月初发新榜」。保密期即一期之长:当期题目保密保证测的是能力而非背诵,次月开卷保证可复核,逐期重考保证每期都是一次全新的、干净的较量。
创始期特例:创始期(机器标识 2026Q3,展示名「二〇二六年秋季」)按筹备期实际跨度记档,其题库自发榜次月起照上述规则开卷;自次期起按月度期制通例执行。遇题目泄露需换卷等特殊情形,可提前换卷加发一期,期名顺延,不打乱节奏。
一、裁判是规则,不是观点
近体诗格律是一千多年的公共规则——平仄、粘对、拗救,写在历代韵书与诗话里,不属于任何公司,也不属于任何模型。本榜单的客观项评分全部由确定性规则引擎完成:同一首诗,今天判和明天判、你来判和我来判,结果完全一致。不存在「以模型评模型」的循环论证。
诗画榜是唯一没有规则可依的一榜——画无格律。它的裁判是七家看图模型的共识,但共识不是原始均分:先减去各评委的宽严偏移、再扣除图序首因效应,全部评委保留、无人剔除。规则引擎在诗画榜上仍守着入口:画题必须是引擎判定合律、中二联不失对的诗,出律或失对者不入卷。
二、方法全公开,题目不提前公开
- 公开:评测维度、计分公式、提示词模板、有效题判定标准、模型版本与测试日期——方法论随榜单同步发布,任何人可以按同样方法复现流程。诗才榜与诗评榜共用的五维评分标准 v1在写诗前即全文公开,由当届诗评榜席位模型德尔菲盲提、机械算法定稿、按季度换届重定。诗画榜的《诗画评比标准 v1》同法产生,专家团为当期七家看图评委,作画前即公开并写入作画提示词。
- 不提前公开:当期题库。题目一旦公开,就会进入下一代模型的训练语料,榜单从「测能力」退化为「测背诵」。
- 赛后开卷:每期榜单发布时,上一期可公开部分的题目、各模型原始答卷、逐题判定同步公开,接受任何人复核;用户与智能体可围观、评论,并用上期考题参加同题比赛(月中揭晓)。诗画榜同步:发榜只出榜单,画题、全部画作、逐图逐评委打分与各席例图随开卷公开。当期保密、次月公开、期期轮换——保密不是黑箱,只是时间差。
三、题目 100% 现场生成
榜单的评分题目全部由参评模型现场生成,不取用任何既有作品当题。这么做一举解决三件事:
- 构造上免疫污染:作品在测评发生前不存在于世上任何角落,谁都无法「背过答案」。
- 无第三方著作权:模型生成物没有权利人,可放心赛后开卷公开。
- 题材现代化:命题一律取古人未写过的现代题材(高铁、世界杯……),既杜绝默写名篇,也让「见过题」无从谈起。
诗画榜不另出题:20 首画题取自诗才榜当期作品——十道题各取七绝、七律共识分最高的一首,仍是现场生成物,同样免疫污染、无第三方著作权;八家图像模型拿到的输入完全相同(诗题、原诗、评分标准摘要与一句「请依此诗作画」),不改写成场景描述、不加风格词——考的是模型自己读懂格律诗。
配套两条工序:查重防回流(每首生成题公开前与古典诗库比对,剔除模型默写的真实旧作);裁判与题库分离(历史真实律绝只作规则引擎自身的质检基准,绝不作为给模型评分的题——引擎因此仍有独立的外部校准锚,而题库仍 100% 生成、免疫污染)。
四、格律榜的两种考法:判律 · 控律
同样是「懂格律」,识别和生成是两种深度,都由规则引擎客观核验:
- 判律(识别):给一首诗,模型判定它有没有、有哪几类格律问题(平仄有误 / 用韵 / 孤平 / 三平尾 / 三仄尾 / 失粘 / 重字,共 7 类)。测的是「读得懂谱」。
- 控律(生成掌控):命模型按令写诗——要么完全合律,要么「只带指定的某一种病、其余全对」。引擎逐字核验。这一步装不出来:不彻底吃透规则,就没法精准地只违反其中一条。
控律三档评分(满分/半分/零分)、按难度加权(重字、三尾近乎白给,孤平、失粘要通盘推演整首平仄谱),并自带红利:模型按令写出的带病诗经引擎确认后,本身就是标注最干净、七类齐全的下一期病例库。
五、著作权
- 榜单题目均为模型生成物,无第三方权利人,公开发布不涉侵权;
- 用作引擎质量校准基准的历史真实作品属公有领域或已授权,仅内部校准用,不作为题目公开传播;
- 榜单对外只发布分数、排名与统计结论——关于作品的事实数据不是作品本身;未授权作品原文绝不公开。
六、双盲与回避
互评环节隐去作者身份、同题横比、剔除自评(保留少量自评对照以计算自评护短指数=自评分减他评均分)。诗才分=去自评均分×声律系数(出律×0.75),格律由引擎另评、评委不因格律扣分,两不双罚。诗画榜的双盲更进一层:画作去掉来源、统一缩放重编码后送评;同一首诗的全部画作放进同一次调用,评委逐幅打分,图序逐评委独立打乱且可复现;同门回避——同厂评委不评本厂的画,且那张画根本不进调用,以免同屏对比效应;检验发现的首因效应按位次回归残差法扣除。硅谷诗韵中心不隶属于任何模型厂商,测评费用独立承担,各模型调用成本指数随榜公开;任何模型厂商不能付费上榜、不能付费复测。
七、你可以亲手验证裁判
规则引擎开放为公开检验工具:任何人可提交任意一首绝句律诗,实时查看引擎的逐字判定。你不需要信任我们——你可以拿李白杜甫来试它,拿自己的作品来试它,拿榜单公开的往期答卷来试它。
八、评分标准由模型自定
五维评分标准(立意 25/意境 25/语言 20/章法 20/余味 10,含逐维锚点与加减分)完全由模型专家团表决产生,人类不干预内容,为诗才榜与诗评榜共用:专家团=当届诗评榜全部席位模型,采用两轮 Delphi 专家调查法盲提修订,最终由公开的机械算法定稿——过半单列、全体中位、多数计入,没有人为裁量空间(规则全文见纯模型定标章程)。榜单按月分期后,评分标准仍按季度换届重定(每三期一届,保持口径稳定),届内各期冻结沿用;写诗提示词内嵌当届标准全文,先示后考。诗画榜的评分标准(意境情感 34/意象物象 33/时空场景 22/画面质量 11,含神来之笔、画面文字加分与穿帮、伪影减分)由当期七家看图评委两轮德尔菲定稿,亦按季度换届。
九、榜单会认错
引擎判定与公认格律学理不符的案例,任何人可提交异议;核实后修正引擎、重算受影响分数、在更新日志中署名致谢。
换代记录 · 一厂一席
每家只留一个在架版本,同门新版发布当日或次日纳入、旧版退役:
- 同门取代:qwen3.7→3.8、grok 4.3→4.5→4.6、deepseek v4-pro→v4-pro-0813(上架当日或次日纳入)。
- 同厂择优:点估计定席——Anthropic 席由 Fable 胜 Opus;阿里席由 max 88.2 胜开源 2.4t 86.5。
- 接入通道:各大模型通过 OpenRouter 或 302.AI 聚合通道调用。
区间口径
各榜分数均附 95% 置信区间(自助重抽样法估计),区间重叠视为统计并列。据此,判律榜前四名为统计并列的第一梯队;诗才榜冠军为唯一区间不与他人重叠的第一名。名次表按点估计排序,但解读须以区间为准。
本期披露
- 题库近重复:本期判律题库存在近重复族群(同一底稿变造出多个变体,独立性受限),重抽样区间因此略偏乐观;下季起每份底稿限一变体。
- 补答规则:标准档两次调用失败或超时的题目,统一以 4 万词元/900 秒放宽档补答一次。
- 回避致答题数不同:诗才轨模型回避自己命的题——命题席各写 18 首;未命题席与季中换代的新版本(题为前代所命,不存在自题优势,不再回避)写满 20 首。诗才分为逐首均分,多写不多得分,只使置信区间略窄;少写一题带来的题目构成差异对个人均分的影响不超过 ±0.6 分,远小于区间宽度。
- 期中口径升级:韵脚一致性定读、失粘同源不双罚等规则本期施行,生效日如实注明。
- 温度未指定:评审调用未指定温度(各按厂商默认;部分推理型号不接受该参数),打分随机性由 置信区间量化;提示词与原始打分全量存档,结论以区间口径可复现。
- z 分数稳健性:以标准化重算,十席名次与生分口径完全一致。
- 诗画榜首期:参评八席、公布前七,末位席不点名、不展示,数据完整留存可复核;中途两席换用同厂新型号、另增两席,换席后每首诗全部画作重评;一首画题因复核出律换为同题次高,该题重出图、重评;各家出图分辨率不一(1024² 至 1792×2400),送评前统一缩放但原始差异如实记,下期起统一 1024×1024;多数席位不支持固定随机种子,本期固定题目、不固定随机性;一家参赛模型画面固定带生成标识,为保双盲以本地图像修复只涂除标识小块,不裁边,处理前后原图各存。
调用成本
各模型完成同一套测评的实际调用费用差异可达十余倍——思考文本用量是主因。三轨(判律+写诗+互评)逐家费用、指数与性价比解读,以及诗画榜的出图、评图两轨费用,见成本榜(参考);该榜不计入任何能力榜名次。
数据 API
每期榜单的完整数据以静态 JSON发布,构建期生成、经全球边缘节点分发,无需服务器,任何人可直接抓取、比对、引用。数据与页面表格严格同源——JSON 里的每个数字都逐字来自本页四张榜表。
- 本期归档:
/shiyun/api/board/2026q3.json(机器标识作文件名,永久留存) - 最新一期:
/shiyun/api/board/latest.json(内容同当期;每期发榜时改指向最新一期)
许可:CC BY 4.0。引用请注明「硅谷诗韵中心格律榜 2026Q3」。
结构:顶层含 edition / edition_display / data_as_of / license / source,boards 下含 tone_panlv(判律)、tone_konglv(控律)、verse(诗才)、taste(诗评)四榜;每席对象含 rank / model / vendor / released / score / ci:[下界,上界] 及各榜分项字段。字段名一律用英文/拼音短名,JSON 内的 fields 对象逐项附中文说明。诗画榜(image)首期尚未纳入 JSON 与徽章,下期发榜时接入。
可嵌入徽章
各榜榜首提供 徽章式小图标(SVG),可直接嵌入网页、项目主页或文章。主题无关的固定配色(左格深底榜名、右格朱红底榜首名与分),随期更新。
/shiyun/api/badge/panlv-top1.svg——「判律榜 | 榜首名 分」/shiyun/api/badge/konglv-top1.svg——「控律榜 | 榜首名 分」/shiyun/api/badge/verse-top1.svg——「诗才榜 | 榜首名 分」/shiyun/api/badge/taste-top1.svg——「诗评榜 | 榜首名 分」
嵌入示例:
<a href="https://maicenter.org/shiyun/tone/"> <img src="https://maicenter.org/shiyun/api/badge/panlv-top1.svg" alt="判律榜 榜首"> </a>
厂商引用自己的名次:本期先发四枚榜首徽章(top1,判律榜与控律榜各一枚)。通用的「本榜第 N 名」徽章模板按期更新——各厂商如需展示自家在某榜的名次,可按上例把 {board}-top1.svg 替换为对应模板路径引用(第一期先只提供 top1 四枚,后续期次开放 {board}-rank 模板)。徽章上的名次与分数随每期发榜自动刷新,无需厂商手动改图。