‹返回
诗画榜

据诗作画评测

诗画榜

谁最能读懂诗、画出诗意 —— 同一首格律诗原样交给各家图像模型作画,七家看图模型双盲互评,比的是「据诗作画」,不是「按说明画图」。

二〇二六年九月榜(首期)· 数据截至 2026-09-11 · 画题 20 首取自诗才榜当期作品 · 画题与画作随十月开卷公开

诗画榜 · 据诗作画

每首诗的画作放进同一次调用,由七家看图模型按《诗画评比标准 v1》逐幅打分,取去偏移、去位置效应后的共识分;席位分为 20 首的平均。分数越高,画得越得诗意。

#图像模型公司诗画分95% 置信区间绝句律诗夺魁前三
1 并列muse-imageMeta76.1[72.0, 80.0]77.774.66/2013/20
1 并列gpt-image-2.5-sunburstOpenAI76.1[70.0, 81.2]74.278.17/2016/20
3qwen-image-3-pro阿里74.1[69.5, 78.6]71.376.96/2013/20
4grok-imagine-image-2.0xAI67.6[62.7, 72.3]67.168.21/206/20
5mai-image-2.6微软63.0[57.9, 68.1]64.361.60/205/20
6seedream-5-0-pro字节62.4[57.4, 67.1]65.259.60/203/20
7gemini-3.1-flash-imageGoogle60.1[55.7, 64.4]58.761.40/204/20

表中「绝句」「律诗」为分体诗画分(各 10 首画题);「夺魁」「前三」为 20 首画题中该席画作居八席之首、进入前三的次数。Meta 与 OpenAI 同为 76.1 分,并列第一;阿里 74.1 与二者区间大面积重叠,三家同属第一梯队。xAI 自成一档;微软、字节、Google 三家分差在三分之内,区间重叠,属统计并列。二十首画题的单题头名由 OpenAI(7 次)、Meta 与阿里(各 6 次)、xAI(1 次)分得;OpenAI 十六次进前三最稳,Meta 单图最高 93.5 分。本期参评八席,榜面公布前七名。出图与评图费用见成本榜「诗画榜成本」一节。

并列第一 · 各出一幅

两家并列榜首,各选本席共识分最高的一幅先行公开;点评只引一联,不出整首,全部画题与画作随十月开卷公开。

Meta muse-image 画作

Meta · muse-image · 93.5 分

「门前小榜标餐价,巷里新炊隔院香」——门口的价目榜、墙上的今日推荐、雨巷里的蓝衣骑手、隔窗笑语的白发老人,一样不落。评委称道「门窗双框分出急缓两种节奏」;榜上「煮软」「姜汤驱寒」四字正扣颔联,画面文字拿了满加分。

OpenAI gpt-image-2.5-sunburst 画作

OpenAI · gpt-image-2.5-sunburst · 93.4 分

「旧照离箱寄远天,开屏又立故堂前」——纸箱里的老照片、平板上的黑白影像、云雾中浮出的老屋灶烟,三层递进把「云端」画成了真正的云。七位评委中六位意境给到 9 分以上,评语「把记忆可视化」。

评分标准

《诗画评比标准 v1(2026Q3)》由七家看图评委两轮德尔菲定出,季内冻结、每季重定。总分=四维加权+加分-减分,折 0–100。

评委宽严

七家看图评委的尺度差异悬殊。本榜不剔除任何评委,而是先减去各自的尺度偏移再取共识 —— 与诗评榜同法,宽严不左右名次。

评委公司平均给分尺度偏移评图数
glm-5v-turbo智谱75.3+7.77140
gpt-6-astraOpenAI69.3+6.73140
qwen3.8-max阿里69.2+6.27140
claude-fable-5.1Anthropic65.2+0.12160
gemini-3.8-flashGoogle64.1-1.96140
deepseek-v4-flash-vision深度求索63.9-1.44160
doubao-seed-2.1字节50.4-17.29140

方法要点

画题 20 首、全部画作、逐图逐评委打分与每家一好一差的例图,随十月诗才榜开卷一并公开。完整八条设计原则见 榜单设计原则。