发布与更新
发布记录
硅谷诗韵中心历次发布与榜单变动,按时间倒序。榜单是活的——新模型发布当日或次日即纳入,名次随之改写;每次变动都留一份当日快照,可原样回看。
发布公告
GPT-6 Sol 上诗韵榜:判律追平 Astra,花费只要五分之一,写诗差一截
读诗追平旗舰,写诗不如旗舰,不换席
Claude Opus 5.5 上诗韵榜:诗才明显胜过 Fable 5.1,看诗最准,给分最严
读诗并列、写诗更好、评诗最严,花费不到三分之一
Grok 4.7 上诗韵榜:判律明显进步、错字定位全场第一,写诗仍不稳
读诗扎实了,写诗还不稳,账单翻倍
Union Alpha,智谱最强模型?
OpenRouter 当天上架的匿名模型,外界猜出自智谱。观察员三卷:判律 85.0、控律 59.2、诗才 78.9,皆高于在榜的 GLM-5.3,诗才显著;身份未证实,不入榜、不占席,评委宽严检验未见同门护短。
诗画榜首期:八家图像模型据诗作画,Meta 与 OpenAI 并列第一
同一首格律诗原样交给各家作画,七家看图模型双盲互评;同门回避、位置校正、去偏移,名次以区间为准。画题与画作随十月开卷公开。
DeepSeek V4.1 Flash 声律两卷内测试考
深度求索限期内测版 deepseek-v4.1-flash 考了声律榜两卷:判律 86.9、控律 54.7,与本厂在榜席位 deepseek-v4-pro-0813 两卷皆统计并列。
GPT-6 Astra 上榜:诗才和控律双榜首,诗评第 2;「AGI 时代」在格律诗里有几分?
写得最好、控得最稳、评得也准;读诗仍是中游。换席
Muse Spark 1.3 复测:编码榜上大跃进,诗词榜上全线退——判律明显退步、诗才掉一名、诗评垫底,Meta 席维持 1.2
读得不如前代、写得不如前代、评得太严——不换席
Gemini 3.8 Flash 上诗韵榜:Flash 顶掉了 Pro——控律守住榜首,诗评从第 8 升到第 4,判卷成本减半
判得差不多、写得更好、评得准多了、抄袭判零分、便宜一半
Fable 5.1 上诗韵榜:错字定位大涨、诗才守住榜首,当评委却变成了「严师」
读得更准、写得没退、评得更严
大模型格律诗词榜
十家旗舰大模型,同题同卷——判律、控律、写诗、互评的全链路较量。裁判是确定性规则引擎,不是观点。
硅谷诗韵中心
把近体诗与词的格律,用确定性规则引擎逐字量给你看。
榜单更新
每次榜单变动——新席位纳入、成绩重算、口径调整——都会留一份当日快照。点日期下的榜名,看的就是那一天的榜单原貌,包括当时的名次、分数与条形图。
- 正在读取更新记录……