首期发布
诗画榜
二〇二六年·九月 · 第一期
谁最能读懂诗、画出诗意——同一首格律诗原样交给八家图像模型作画,七家看图模型双盲互评。比的是「据诗作画」,不是「按说明画图」。
查看榜单 →本期榜面(前七名)
并列第一 · Meta muse-image / OpenAI gpt-image-2.5-sunburst
同为 76.1 分。Meta 单图最高 93.5 分、六题夺魁;OpenAI 七题夺魁、十六题进前三,最稳。阿里 qwen-image-3-pro 74.1 分紧随其后,三家区间大面积重叠,同属第一梯队。
看完整榜面与置信区间 →
第四至第七
xAI grok-imagine-image-2.0 67.6 自成一档;微软 mai-image-2.6 63.0、字节 seedream-5-0-pro 62.4、Google gemini-3.1-flash-image 60.1 三家分差在三分之内、区间重叠,属统计并列。
本期参评八席,榜面公布前七名 →
分体成绩、夺魁与前三次数、评委宽严与方法要点,均在榜页;评分口径见《诗画评比标准 v1》(榜页「评分标准」一节)。
这一期的分量
8
家图像模型
20
首画题
7
家看图评委
160
幅参评画作
140
次双盲评图
95%
置信区间口径
怎么比的
- 题从诗才榜来。20 首画题全部取自诗才榜当期作品——十道题各取七绝、七律共识分最高的一首,均为语言模型现场创作、经确定性规则引擎逐字核验合律且中二联不判失对的近体诗,无第三方著作权。
- 八家输入完全相同。诗题、诗句原文,加同一份评分标准摘要与一句「请依此诗作画」。不改写成场景描述、不追加风格词——考的是模型自己读懂格律诗的能力。
- 双盲、一诗一评。画作去掉来源、统一缩放重编码后,同一首诗的全部画作放进同一次调用,评委逐幅打分,参照系完全一致;图序逐评委独立打乱且可复现。
- 同门回避。同厂评委不评本厂的画,那张画根本不进调用,避免同屏对比效应。
- 位置校正与去偏移。检验发现排在首位的画平均得分偏高(t = −2.50),按位次回归残差法扣除;七位评委宽严从 +7.77 到 −17.29,先减去各自尺度偏移再取共识,不剔除任何评委。
- 名次以区间为准。席位分为 20 首共识分均值,bootstrap 重抽 1000 次给出 95% 区间,区间重叠视为统计并列;榜面分相同即并列。
完整方法与费用披露见榜页「方法要点」。
本期披露
- 只公布前七名。末位席成绩与画作内部存档,不点名、不展示;逐图逐评委打分与全部中间数据完整留存,可复核。
- 画题与画作随十月开卷公开。与诗才榜同步:发榜只出榜单,开卷时一并公开 20 首画题、160 幅画作、逐图分与各席例图。
- 中途换席、重评。两家换用同厂新型号、另新增两家;换席后每首诗的全部画作重新评过,不只补评新席。一首画题在发布前因复核出律被换成同题次高,该题八席重出图、七评委重评。
- 分辨率参差。各家接口默认出图分辨率不一,送评前虽已统一缩放,原始分辨率差异仍可能影响细节;下期起统一 1024×1024。多数席位不支持固定随机种子,本期固定题目、不固定随机性。
- 厂商标识处理。一家参赛模型画面固定带生成标识,为保双盲用本地图像修复只涂除标识小块,不裁边,处理前后原图各存一份。