
一句话看懂:一项针对7个前沿大模型生成“骑自行车的鹈鹕”SVG图像的实验表明,AI实验室并未刻意针对这一热门非正式基准进行优化(即“Pelicanmaxxing”)。测试结果显示,所有模型在该特定组合上的表现并未显著优于其他动物-交通工具组合。
事件核心:发生了什么
Simon Willison过去几年在测试新大模型时,一直使用“生成一幅鹈鹕骑自行车的SVG”作为提示词,这一做法逐渐成为Hacker News上知名的非正式基准测试。随着该基准影响力的扩大,业界开始讨论AI实验室是否可能针对这一特定任务进行针对性训练(术语称为“benchmaxxing”)。
为验证这一假设,测试者设计了一项对照实验:构建了8种动物×6种交通工具的48种提示组合(共1008幅SVG图像),对7个前沿模型——GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro——进行了横向评估。所有图像均经过渲染、LLM评分(由GPT-5.6 Luna担任裁判,从动物识别度、交通工具识别度、动作连贯性三个维度打分)和特征提取三个步骤。
为什么重要
该实验提供了首个量化证据,表明当前主流AI实验室并未针对特定热门测试用例进行后台优化。在模型估值达数千亿美元的行业背景下,这一发现具有三方面意义:首先,它说明了即使是最有影响力的非官方基准,也难以驱动实验室改变训练策略;其次,它验证了“鹈鹕骑自行车”作为基准的有效性——该任务确实能反映模型的通用图像生成能力而非专项能力;第三,为开发者提供了一个可复现的评估方法论,可用于检测未来模型是否出现针对性优化倾向。
对用户/开发者/创作者的影响
对开发者而言,该实验展示了如何通过构建多样化的测试集(而非依赖单一热门提示)来客观评估模型能力。如需评估自有应用中选择的模型,建议遵循相同原则:设计至少包含8-10个具有代表性的提示样本,且使用不同的评估维度(如识别准确率、构图合理性等)。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对AI创作者而言,结果显示即使是最佳模型也存在能力分布不均——例如所有模型对猫、鲸、浣熊的生成质量显著优于鹈鹕(鹈鹕在动物评分中仅列第六),自行车在所有交通工具中排名倒数第二。这表明当前模型的视觉生成能力仍存在明显的物种和物体偏向性。
值得关注的后续
1. 模型表现的时间轴变化:可以对比同一模型不同版本(如GPT-4o与GPT-5.6)在该测试集上的评分趋势,以更早发现针对性优化迹象。
2. 开源模型的对比:当前测试中的开源模型(如Qwen3.7-Max、GLM-5.2)在综合评分上是否显著落后于闭源模型?开发者可据此评估开源方案的实际可用性。
3. 行业基准迭代:如果“骑自行车的鹈鹕”基准影响力持续扩大,未来是否会有实验室主动发布类似规模化测试集以建立更严谨的行业标准?


![[Bug]: Bug Report: Base64 Image String Being Split into Individual Characters](https://www.chat-gpts.plus/wp-content/uploads/2026/07/9302-a8607eee-768x403.jpg)