一分钟速览
- 背景:安全研究者 Simon Willison 多年来用同一句提示词——「画一只骑自行车的鹈鹕的 SVG」——测试每个新发布的大模型,这个玩笑式的小测试成了 AI 圈最出名的非正式基准之一。于是有人怀疑:各家实验室会不会在偷偷针对它「刷分」(pelicanmaxxing)?
- 研究者 Dylan Castillo 做了个实验来回答:8 种动物 × 6 种载具 = 48 个提示词,7 个前沿模型,每个提示各生成 3 次,共 **1008 张 SVG**,再用 LLM 打分 + 特征提取来分析。
- 主结论:**几乎没有刷分证据**。鹈鹕在 8 种动物里画得排第 6,自行车在 6 种载具里倒数第二,「鹈鹕骑车」这个组合在 48 个里排第 42;做了难度校正的回归分析也没发现任何实验室对鹈鹕有显著的专项加成。
- 那「所有鹈鹕都朝右」呢?是真的(21 张全朝右),但**并不特殊**:全部 1008 张里 60% 都朝右,其中自行车 81% 朝右、鹈鹕 78% 朝右——这只是「侧面比正面好画」的自然结果,别的组合(羚羊/鹈鹕骑滑板车 20/21、鹭骑车 19/21)也接近全朝右。
- 冷静一句:作者自己老实列了局限(只用单一 LLM 当评委、总共约 80 美元预算、且检测不到「整体优化 SVG 生成」这种更隐蔽的刷法)——所以结论是「没有明显证据」,而不是「绝对没有」。
⚑ 本文基于研究者 Dylan Castillo 的原文实验《Are AI labs pelicanmaxxing?》(2026-07-18 发布、07-22 更新,代码开源于 GitHub,本站已直接核阅其全文)整理;实验设计、评分方法、五条证据与局限均以其原文为准。这是其单人、约 80 美元预算下的实验,最终口径是「刷分证据不足」而非定论。文中模型名称(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro 等)为其原文表述。二手摘要里「所有图都朝右 = 存在偏见」的强调,与原文主结论不符,本文按原文更正。
一句「画只骑车的鹈鹕」,如何成了 AI 圈的隐形考场
如果你常看 AI 新闻,可能见过一个古怪的梗:每当有新模型发布,总有人让它「画一只骑自行车的鹈鹕」,然后把结果晒出来对比。这不是无聊——它出自安全研究者 Simon Willison,他多年来**用同一句提示词测试每一个重要的大模型**:「Generate an SVG of a pelican riding a bicycle」。这个原本半开玩笑的小测试,如今成了 AI 圈最出名的非正式基准之一,相关对比常年霸占 Hacker News 新品发布帖的高赞评论。
出名到一定程度,怀疑就来了:当一个基准足够火、火到能影响用户对模型的印象,而背后是几十亿甚至上万亿美元的竞争——各家实验室会不会**偷偷针对这个基准做优化**,让自己的模型「恰好」特别会画骑车的鹈鹕?这种行为被戏称为「pelicanmaxxing」。研究者 Dylan Castillo 决定用数据认真查一下。
1008 张 SVG,是怎么测出来的
要判断「有没有专门针对鹈鹕刷分」,光靠感觉不行,得有对照。作者的设计思路很清晰:把「鹈鹕骑自行车」放进一个更大的网格里,看它是不是被特殊对待了。
提示词网格:8 种动物(鹈鹕、火烈鸟、鹭、水獭、浣熊、羚羊、鲸、猫)× 6 种载具(自行车、独轮车、滑板、滑板车、飞机、船)= 48 个组合,「鹈鹕 + 自行车」只是其中一格,其余提示词措辞几乎和原版一致,只换动物和载具。模型与采样:通过 OpenRouter 测了 7 个前沿模型,每个提示各生成 3 次、温度 1.0,共 1008 张 SVG。三步流水线:先把每张 SVG 渲染成 PNG(渲染失败才重生成,1008 张里只重试了 11 次);再用一个 LLM 评委给「动物、载具、动作连贯性」各打 1-5 分;最后用另一个模型做特征提取,记录它认出的动物、载具、朝向和画面元素。核心假设是:如果某家真在刷分,那「鹈鹕这一行」「自行车这一列」或「鹈鹕骑车这一格」的得分,应该明显高于它本该有的水平。

五条证据,都指向「没在刷鹈鹕」
把 1008 张图跑完分析,作者列出五条证据,方向出奇地一致。
动物排名:鹈鹕在 8 种动物里平均分排第 6,落在猫、鲸、浣熊、鹭、羚羊之后——要是真在刷分,鹈鹕本该名列前茅,结果它在下半区。载具排名:自行车在 6 种载具里倒数第二(只比「飞机」略好,而且自行车本身就难画——要两个对称轮子、连到两轴的车架、车把、座位、脚踏,评委在 2/3 的自行车图上都挑出缺件)。组合排名:「鹈鹕骑自行车」在 48 个组合里排到第 42。难度校正后:作者又做了一个固定效应回归,把 48 个组合各自的固有难度扣除后,去看每家模型对鹈鹕/自行车/鹈鹕骑车有没有「专项加成」——结果没有一个通过显著性检验,唯一一个勉强越线的(Gemini 在自行车列)在多重比较校正下也站不住,恰好就是纯随机能预期到的那 1 个假阳性。
一句话:**鹈鹕没被画得比别的动物好,自行车也没被画得比别的载具好,没有哪家把这个组合画得超出它自身水平。** 至少没有明目张胆地这么做。
「所有鹈鹕都朝右」,其实不是偏见的证据
这次实验里最出圈的一个细节,是「所有鹈鹕骑车图都朝右」。很多人拿它当「模型在背同一张构图」的铁证。但作者一查数据,发现这个推断站不住。
「21 张鹈鹕骑车图全部朝右」确实为真,也确实是唯一 21/21 全朝右的动物-载具组合。但朝右本身太普遍了:全部 1008 张图里 60% 都朝右;分载具看,自行车 81% 朝右、滑板车 83% 朝右;分动物看,鹈鹕 78% 朝右、羚羊 78%、鹭 77%。原因很朴素——鹈鹕和自行车都很难画成正对观众的样子,模型几乎都从侧面画,于是要么朝左要么朝右,很少有「说不清朝向」的。而且别的组合也接近全朝右:羚羊、鹈鹕骑滑板车都是 20/21,鹭骑车 19/21——所以「21/21」并不是什么异常值。至于「总出现太阳、围巾」等元素?作者也查了:每一张火烈鸟乘船图都有太阳,水獭坐飞机 38% 戴围巾,猫骑车 38% 带篮子——几乎每个组合都有自己爱重复的元素,鹈鹕骑车并没有更特殊。
换句话说,那个看起来「细思恐极」的朝向一致,用「侧面更好画」就能解释,不需要搬出「模型在背图」的阴谋论。
它证明了什么,又没证明什么
作者的诚实,恰恰体现在他没把话说满。
第一,评委是单一模型:所有分数都出自一个 LLM 评委(GPT-5.6 Luna),且它和参赛选手之一(GPT-5.6 Terra)同门——不过因为每家都画全部 48 个组合,评委的口味偏好会同时抬高某家的整张网格,而这个分析只看「同一家内部的差异」,所以影响有限。第二,检测不到「整体刷 SVG」:如果某家不是专刷鹈鹕,而是把「SVG 生成」这件事整体优化了(作者点名 Google/DeepMind 就公开这么做),那它每一格都会一起变好,看起来和「就是画得好」完全一样,这个实验区分不了。第三,预算很小:整个实验只花了约 80 美元 API 额度,因此只能每格 3 张、单一评委、7 个模型,样本有限、置信区间偏宽,太小的加成它也测不出来。
所以这篇文章的正确读法是:**「没有找到实验室专门给鹈鹕刷分的明显证据」**,而不是「实验室绝对清白」。但即便如此,它已经足够回敬那句流行的怀疑——用作者的结论原话说:抱歉了各位阴谋论者,几乎没有证据表明 AI 实验室在 pelicanmaxxing,至少没在以一种明显的方式这么做。
来源:Dylan Castillo《Are AI labs pelicanmaxxing?》(Iwana Labs,2026-07-18 发布、07-22 更新,本站直接核阅全文,代码开源于 GitHub;实验设计、1008 张 SVG、五条证据、朝向统计与三条局限均出自此文)。该基准的由来(Simon Willison 多年用「骑车鹈鹕」测试新模型)为原文所述背景。本文所涉数据为作者单人、约 80 美元预算下的实验结果,结论口径为「刷分证据不足」。配图为原文页面实测截图。
面对「AI 是不是在给出名基准刷分」的怀疑,有人真去画了 1008 只动物来验——结论是:大概没有;而那个「全都朝右」的细思恐极,不过是因为侧面比正面好画而已。


