AI 实验室在针对“鹈鹕测试”进行特供优化吗?
Hacker News 摘要原标题:Are AI Labs Pelicanmaxxing?
这篇文章由 Dylan Castillo 撰写,探讨了顶级 AI 实验室是否为了在知名非正式基准测试中取得好成绩而进行了针对性优化(作者称之为 Pelicanmaxxing)。
背景
过去几年里,Simon Willison 习惯用同一个提示词来测试每一个新发布的 LLM:要求模型生成一张鹈鹕骑自行车的 SVG 图像。这个非正式测试在 Hacker News 等社区非常出名。作者怀疑,由于利益巨大,AI 实验室可能会专门针对这个特定的提示词进行训练,以在社交媒体上获得好评。
测试方法
作者设计了一个 8 种动物乘以 6 种交通工具的网格,共 48 个提示词组合,其中鹈鹕骑自行车只是其中一格。
1. 动物:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫。
2. 交通工具:自行车、独轮车、滑板、踏板车、飞机、船。
作者测试了 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro 这七款模型。每个提示词生成 3 个样本,共计 1008 个 SVG。
评分流程分为三步:
3. 渲染:将 SVG 转为 PNG,并记录失败重试次数。
4. 评分:使用 GPT-5.6 Luna 作为评委,对动物、交通工具和动作连贯性进行 1 到 5 分的打分。
5. 特征提取:使用 Gemini 3.1 Flash-Lite 识别图像中的朝向和场景元素。
证据分析
证据 1:目测并无优待
作者肉眼观察了所有生成的图像。结果显示,鹈鹕骑自行车的图像质量并没有明显高于该模型生成的其他组合。那些能画好鹈鹕骑自行车的模型,画其他动物骑车的水平也同样出色。
证据 2:实验室并不擅长画鹈鹕
在所有模型的平均得分中,鹈鹕的得分仅排在第 6 位(共 8 种动物),落后于猫、鲸鱼、浣熊、苍鹭和羚羊。如果实验室进行了针对性训练,鹈鹕应该排在首位,但事实并非如此。
证据 3:实验室并不擅长画自行车
自行车在交通工具的评分中排在倒数第二,仅略高于飞机。评分模型发现三分之二的自行车图像存在缺少零件或车架未连接的问题。虽然自行车确实比滑板更难画,但这一低排名也侧面说明实验室没有对其进行特殊优化。
证据 4:调整难度后的统计分析
作者使用了固定效应回归模型来消除不同组合本身的难度差异。
1. 在所有模型中,没有任何一个模型在画鹈鹕时表现出显著的加分。
2. 只有 Gemini 3.5 Flash 在自行车这一项上有微弱的统计学优势,但考虑到多次比较的随机性,这很可能只是一个假阳性。
3. 在鹈鹕加自行车的特定组合上,没有任何模型表现出显著的额外加分。得分最高的 GLM-5.2 虽然有些许提升,但在统计学上并不显著。
证据 5:场景没有被记忆的迹象
有人认为鹈鹕骑自行车总是朝向右侧或带有围巾等元素是模型记忆了特定训练数据的表现。
1. 朝向问题:虽然 21 张鹈鹕骑自行车的图全部朝向右侧,但统计发现自行车和鹈鹕本身就极易被画成朝向右侧(约 80% 的比例)。这种趋同性在羚羊骑踏板车等其他组合中也同样存在。
2. 场景元素:作者统计了太阳、云、帽子、围巾等元素的出现频率。结果显示,鹈鹕骑自行车并没有展现出独特的元素集合。例如,火烈鸟在船上时总会画出太阳,而猫骑自行车时经常有篮子,这些都是模型的普遍倾向,而非针对单一基准的作弊。
实验局限性
1. 评分完全依赖于 GPT-5.6 Luna 这一单一模型,如果该模型本身判断能力有限,结果可能受影响。
2. 实验无法检测模型是否对生成 SVG 这一整体任务进行了优化,只能检测是否针对特定提示词作弊。
3. 预算有限,每组只生成了 3 个样本,且仅测试了 7 个模型。
结论
作者认为目前没有证据表明 AI 实验室在针对鹈鹕骑自行车这个基准进行作弊。鹈鹕和自行车的绘画水平并没有超出模型的平均水平,特定组合的表现也符合预期。虽然某些实验室(如谷歌 DeepMind)曾公开表示优化过 SVG 生成能力,但这属于提升模型通用能力,而非针对特定测试题的作弊。用户可以放心,实验室没有为了取悦社区而专门产生数以万计的鹈鹕骑车图。