‹返回
设计原则

榜单设计原则

判律榜——谁读得懂谱
控律榜——谁驾驭得住规则
诗才榜——谁最会写诗
诗评榜——谁最有品鉴力
诗画榜——谁最能读懂诗、画出诗意
五榜合称硅谷诗韵中心大模型格律诗词榜:以同一把确定性格律尺,量大模型的诗词判断、写作与品鉴之力;诗画榜则把这把尺量过的诗原样交给图像模型,量它们「据诗作画」之力。其中判律榜与控律榜同属格律榜——会判不等于会写,故一榜一冠军,分列不并。

本原则适用于硅谷诗韵中心全系测评。

期制

榜单按月分期,每期月初发榜。每期有双轨期名:机器标识如 2026M10(用于存档、API、学术引用;创始期沿用 2026Q3),展示名如「二〇二六年十月」(用于页面标题)。各榜页统一标注期名与数据口径。

期次运行规则:

期界与节奏:一期=本期发榜日起,至次期发榜日前止;月度闭环为「月初发榜(并公开上期全部材料、开启同题比赛)→ 月中揭晓同题比赛 → 期内滚动补考新模型 → 次月初发新榜」。保密期即一期之长:当期题目保密保证测的是能力而非背诵,次月开卷保证可复核,逐期重考保证每期都是一次全新的、干净的较量。

创始期特例:创始期(机器标识 2026Q3,展示名「二〇二六年秋季」)按筹备期实际跨度记档,其题库自发榜次月起照上述规则开卷;自次期起按月度期制通例执行。遇题目泄露需换卷等特殊情形,可提前换卷加发一期,期名顺延,不打乱节奏。

一、裁判是规则,不是观点

近体诗格律是一千多年的公共规则——平仄、粘对、拗救,写在历代韵书与诗话里,不属于任何公司,也不属于任何模型。本榜单的客观项评分全部由确定性规则引擎完成:同一首诗,今天判和明天判、你来判和我来判,结果完全一致。不存在「以模型评模型」的循环论证。

诗画榜是唯一没有规则可依的一榜——画无格律。它的裁判是七家看图模型的共识,但共识不是原始均分:先减去各评委的宽严偏移、再扣除图序首因效应,全部评委保留、无人剔除。规则引擎在诗画榜上仍守着入口:画题必须是引擎判定合律、中二联不失对的诗,出律或失对者不入卷。

二、方法全公开,题目不提前公开

三、题目 100% 现场生成

榜单的评分题目全部由参评模型现场生成,不取用任何既有作品当题。这么做一举解决三件事:

诗画榜不另出题:20 首画题取自诗才榜当期作品——十道题各取七绝、七律共识分最高的一首,仍是现场生成物,同样免疫污染、无第三方著作权;八家图像模型拿到的输入完全相同(诗题、原诗、评分标准摘要与一句「请依此诗作画」),不改写成场景描述、不加风格词——考的是模型自己读懂格律诗。

配套两条工序:查重防回流(每首生成题公开前与古典诗库比对,剔除模型默写的真实旧作);裁判与题库分离(历史真实律绝只作规则引擎自身的质检基准,绝不作为给模型评分的题——引擎因此仍有独立的外部校准锚,而题库仍 100% 生成、免疫污染)。

四、格律榜的两种考法:判律 · 控律

同样是「懂格律」,识别和生成是两种深度,都由规则引擎客观核验:

控律三档评分(满分/半分/零分)、按难度加权(重字、三尾近乎白给,孤平、失粘要通盘推演整首平仄谱),并自带红利:模型按令写出的带病诗经引擎确认后,本身就是标注最干净、七类齐全的下一期病例库。

五、著作权

六、双盲与回避

互评环节隐去作者身份、同题横比、剔除自评(保留少量自评对照以计算自评护短指数=自评分减他评均分)。诗才分=去自评均分×声律系数(出律×0.75),格律由引擎另评、评委不因格律扣分,两不双罚。诗画榜的双盲更进一层:画作去掉来源、统一缩放重编码后送评;同一首诗的全部画作放进同一次调用,评委逐幅打分,图序逐评委独立打乱且可复现;同门回避——同厂评委不评本厂的画,且那张画根本不进调用,以免同屏对比效应;检验发现的首因效应按位次回归残差法扣除。硅谷诗韵中心不隶属于任何模型厂商,测评费用独立承担,各模型调用成本指数随榜公开;任何模型厂商不能付费上榜、不能付费复测。

七、你可以亲手验证裁判

规则引擎开放为公开检验工具:任何人可提交任意一首绝句律诗,实时查看引擎的逐字判定。你不需要信任我们——你可以拿李白杜甫来试它,拿自己的作品来试它,拿榜单公开的往期答卷来试它。

八、评分标准由模型自定

五维评分标准(立意 25/意境 25/语言 20/章法 20/余味 10,含逐维锚点与加减分)完全由模型专家团表决产生,人类不干预内容,为诗才榜与诗评榜共用:专家团=当届诗评榜全部席位模型,采用两轮 Delphi 专家调查法盲提修订,最终由公开的机械算法定稿——过半单列、全体中位、多数计入,没有人为裁量空间(规则全文见纯模型定标章程)。榜单按月分期后,评分标准仍按季度换届重定(每三期一届,保持口径稳定),届内各期冻结沿用;写诗提示词内嵌当届标准全文,先示后考。诗画榜的评分标准(意境情感 34/意象物象 33/时空场景 22/画面质量 11,含神来之笔、画面文字加分与穿帮、伪影减分)由当期七家看图评委两轮德尔菲定稿,亦按季度换届。

九、榜单会认错

引擎判定与公认格律学理不符的案例,任何人可提交异议;核实后修正引擎、重算受影响分数、在更新日志中署名致谢。


换代记录 · 一厂一席

每家只留一个在架版本,同门新版发布当日或次日纳入、旧版退役:

区间口径

各榜分数均附 95% 置信区间(自助重抽样法估计),区间重叠视为统计并列。据此,判律榜前四名为统计并列的第一梯队;诗才榜冠军为唯一区间不与他人重叠的第一名。名次表按点估计排序,但解读须以区间为准。

本期披露

调用成本

各模型完成同一套测评的实际调用费用差异可达十余倍——思考文本用量是主因。三轨(判律+写诗+互评)逐家费用、指数与性价比解读,以及诗画榜的出图、评图两轨费用,见成本榜(参考);该榜不计入任何能力榜名次。

数据 API

每期榜单的完整数据以静态 JSON发布,构建期生成、经全球边缘节点分发,无需服务器,任何人可直接抓取、比对、引用。数据与页面表格严格同源——JSON 里的每个数字都逐字来自本页四张榜表。

许可:CC BY 4.0。引用请注明「硅谷诗韵中心格律榜 2026Q3」。

结构:顶层含 edition / edition_display / data_as_of / license / source,boards 下含 tone_panlv(判律)、tone_konglv(控律)、verse(诗才)、taste(诗评)四榜;每席对象含 rank / model / vendor / released / score / ci:[下界,上界] 及各榜分项字段。字段名一律用英文/拼音短名,JSON 内的 fields 对象逐项附中文说明。诗画榜(image)首期尚未纳入 JSON 与徽章,下期发榜时接入。

可嵌入徽章

各榜榜首提供 徽章式小图标(SVG),可直接嵌入网页、项目主页或文章。主题无关的固定配色(左格深底榜名、右格朱红底榜首名与分),随期更新。

嵌入示例:

<a href="https://maicenter.org/shiyun/tone/">
  <img src="https://maicenter.org/shiyun/api/badge/panlv-top1.svg" alt="判律榜 榜首">
</a>

厂商引用自己的名次:本期先发四枚榜首徽章(top1,判律榜与控律榜各一枚)。通用的「本榜第 N 名」徽章模板按期更新——各厂商如需展示自家在某榜的名次,可按上例把 {board}-top1.svg 替换为对应模板路径引用(第一期先只提供 top1 四枚,后续期次开放 {board}-rank 模板)。徽章上的名次与分数随每期发榜自动刷新,无需厂商手动改图。