AI 实验室在 “Pelicanmaxxing” 吗?

一项系统性的对照实验否定了“AI模型被定向优化生成特定小众图像”的传闻。研究者用8种动物×6种交通工具共48组提示词,测试了7款主流模型,并未发现“鹈鹕骑自行车”显著优于其他组合的证据。

AI 实验室在

一句话看懂:一项系统性的对照实验否定了“AI模型被定向优化生成特定小众图像”的传闻。研究者用8种动物×6种交通工具共48组提示词,测试了7款主流模型,并未发现“鹈鹕骑自行车”显著优于其他组合的证据。

事件核心:发生了什么

2026年7月22日,技术分析师Dylan Castillo发布了一项严谨的对照研究,试图回答AI社区长期热议的问题——AI实验室是否刻意训练模型生成“鹈鹕骑自行车”(pelican riding bicycle)这一特定图像。研究者设置了8种动物(含鹈鹕)×6种交通工具(含自行车)共48种组合,每组合通过7款模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)各生成3次,共计1008张图像。同时使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估图像质量。结论明确:鹈鹕的绘图质量并未明显优于其他动物,自行车也未优于其他交通工具,且没有任何实验室在“鹈鹕+自行车”组合上表现出超出预期的增强。其中GLM-5.2的表现最接近异常,但效应微弱且未达统计显著性。

为什么重要

这一研究澄清了长期困扰AI社区的一个认知偏差。此前许多用户注意到模型在生成“鹈鹕骑自行车”时表现突出,猜测训练数据可能被定向增强。Castillo用控制变量法证明了这更可能是心理上的确认偏误,而非模型训练的真实倾向。对于理解大模型训练数据的构成与评价方法的科学性,这是一次有价值的“过滤”。同时,研究使用了7款当前主流闭源与开源模型(包括GLM和DeepSeek),覆盖了2026年主要的图像生成竞争格局,没有单一家实验室被“抓住把柄”,也侧面说明各厂商在训练数据上并未进行这类细微的定向优化。

对用户/开发者/创作者的影响

对于普通用户和AI图像生成工具的创作者,这一结论意味着不应轻信“某模型擅长画某小众物体”的社区传说。实际图像质量受到提示词设计、随机种子和模型温度等多变量影响。开发者在评估多模态模型时,应避免使用少量、高关注度的基准测试用例,而应采用系统性、对照式的评估方法(如Castillo使用的8×6网格)。对于AI内容创作者,这也意味着当前主流模型在“常识物体”生成上的基础能力较为均衡,竞争中拼的是对提示词的精确控制和风格偏好,而非某个模型的“隐藏特长”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,GLM-5.2的微弱异常是否会在更大样本或更高难度提示词下被重复验证,这在统计上仍值得追踪。第二,Castillo的方法论可被其他研究者复用,未来如果出现类似“特定组合显著异常”的案例,需要一个标准化的评估框架。第三,AI图像生成领域的评测正在从“比谁画得好”转向“比谁对特定组合更公平”,这一趋势可能影响未来模型迭代时的训练数据准备策略。

来源:Simon Willison

celebrityanime
celebrityanime
文章: 14763

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注