
一句话看懂:一项系统性的对照实验否定了“AI模型被定向优化生成特定小众图像”的传闻。研究者用8种动物×6种交通工具共48组提示词,测试了7款主流模型,并未发现“鹈鹕骑自行车”显著优于其他组合的证据。
事件核心:发生了什么
2026年7月22日,技术分析师Dylan Castillo发布了一项严谨的对照研究,试图回答AI社区长期热议的问题——AI实验室是否刻意训练模型生成“鹈鹕骑自行车”(pelican riding bicycle)这一特定图像。研究者设置了8种动物(含鹈鹕)×6种交通工具(含自行车)共48种组合,每组合通过7款模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)各生成3次,共计1008张图像。同时使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估图像质量。结论明确:鹈鹕的绘图质量并未明显优于其他动物,自行车也未优于其他交通工具,且没有任何实验室在“鹈鹕+自行车”组合上表现出超出预期的增强。其中GLM-5.2的表现最接近异常,但效应微弱且未达统计显著性。
为什么重要
这一研究澄清了长期困扰AI社区的一个认知偏差。此前许多用户注意到模型在生成“鹈鹕骑自行车”时表现突出,猜测训练数据可能被定向增强。Castillo用控制变量法证明了这更可能是心理上的确认偏误,而非模型训练的真实倾向。对于理解大模型训练数据的构成与评价方法的科学性,这是一次有价值的“过滤”。同时,研究使用了7款当前主流闭源与开源模型(包括GLM和DeepSeek),覆盖了2026年主要的图像生成竞争格局,没有单一家实验室被“抓住把柄”,也侧面说明各厂商在训练数据上并未进行这类细微的定向优化。
对用户/开发者/创作者的影响
对于普通用户和AI图像生成工具的创作者,这一结论意味着不应轻信“某模型擅长画某小众物体”的社区传说。实际图像质量受到提示词设计、随机种子和模型温度等多变量影响。开发者在评估多模态模型时,应避免使用少量、高关注度的基准测试用例,而应采用系统性、对照式的评估方法(如Castillo使用的8×6网格)。对于AI内容创作者,这也意味着当前主流模型在“常识物体”生成上的基础能力较为均衡,竞争中拼的是对提示词的精确控制和风格偏好,而非某个模型的“隐藏特长”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,GLM-5.2的微弱异常是否会在更大样本或更高难度提示词下被重复验证,这在统计上仍值得追踪。第二,Castillo的方法论可被其他研究者复用,未来如果出现类似“特定组合显著异常”的案例,需要一个标准化的评估框架。第三,AI图像生成领域的评测正在从“比谁画得好”转向“比谁对特定组合更公平”,这一趋势可能影响未来模型迭代时的训练数据准备策略。

![[BUG]: Error: SQLite database error](https://www.chat-gpts.plus/wp-content/uploads/2026/07/2564-70af5d26-768x403.jpg)
