为什么全世界的 AI 都画不好一只骑自行车的鹈鹕

一篇来自掘金社区的文章讨论了一个被反复验证的现象——主流图像生成模型很难稳定画出“一只骑自行车的鹈鹕”。它值得关注,不是因为鹈鹕本身,而是因为这类失败案例暴露了当前图像大模型在组合推理和空间关系理解上的结构性短板。

一句话看懂:一篇来自掘金社区的文章讨论了一个被反复验证的现象——主流图像生成模型很难稳定画出“一只骑自行车的鹈鹕”。它值得关注,不是因为鹈鹕本身,而是因为这类失败案例暴露了当前图像大模型在组合推理和空间关系理解上的结构性短板。

事件核心:发生了什么

这篇首发于掘金社区的文章,围绕一个在 AI 圈流传已久的测试题展开:让图像生成模型画“一只骑自行车的鹈鹕”。作者观察到,无论是闭源商业模型还是开源图像生成方案,结果往往出现鹈鹕与自行车分离、骑姿错乱、肢体数量异常,或干脆退化成“鸟站在车旁”这类折中画面。

目前公开信息显示,原文并未给出统一的量化评测表格,更多是基于多模型实际生成结果的对比与归因分析。文章的核心判断是:问题不在“鹈鹕”或“自行车”这两个单独概念上,而在于模型需要同时处理主体、道具、动作与物理接触关系。

为什么重要

图像生成经过几年迭代,单物体、单场景的写实能力已经相当高。但“骑”这个动作隐含了跨物体的空间约束:身体需跨坐、翅膀或肢体需接触车把与脚踏、重心需合理。这正是当前扩散模型与多模态大模型的薄弱环节。

它牵出一个更实际的行业议题:如果模型无法可靠完成组合式指令,那么在电商出图、广告素材、游戏原画、工业设计草图等场景中,生成结果就仍需大量人工返工。这直接影响 AI 应用的生产力叙事,也解释了为什么各家厂商在训练中持续加入空间关系与物理常识数据。

对用户/开发者/创作者的影响

对普通用户来说,这类案例提醒大家:把图像生成当成“灵感起点”比当成“成品交付”更现实,遇到复杂构图需求时应拆分提示词、分步生成。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和创作者而言,评估一个图像生成 API 或开源模型时,除了看画质,还应加入组合指令、空间关系、数量一致性等测试用例。做 AI 应用集成时,可在提示词层做结构化约束,或引入后处理与人工审核环节,降低返工率。

值得关注的后续

一是主流模型是否会在版本更新中改善组合与空间推理能力;二是开源社区是否会出现针对这类任务的专项评测集或微调方案;三是厂商在宣传图像生成能力时,是否会从“画得像”转向“画得对”。这些都值得持续观察。

来源:juejin

celebrityanime
celebrityanime
文章: 24675

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注