用GPT-5.6、Claude、Gemini和Grok“画”出蒙娜丽莎

一家AI评测团队让GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash用彩色铅笔工具临摹《蒙娜丽莎》和《星夜》等目标图像,结果GPT-5.6得分最高、成本最低,而Claude Fable 5耗时最长、表现却最差。这个实验不是为了比“谁更像艺术家”,而是暴露了…

用GPT-5.6、Claude、Gemini和Grok“画”出蒙娜丽莎

一句话看懂:一家AI评测团队让GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash用彩色铅笔工具临摹《蒙娜丽莎》和《星夜》等目标图像,结果GPT-5.6得分最高、成本最低,而Claude Fable 5耗时最长、表现却最差。这个实验不是为了比“谁更像艺术家”,而是暴露了前沿模型在开放型模糊任务上的真实能力与成本差异。

事件核心:发生了什么

评测团队TryAI构建了一个“画板竞技场”,给每个模型一个白色画布和一套彩色铅笔工具(包括设置颜色、笔尖宽度、压力、涂抹、擦除等操作)。模型需要自主调用工具,临摹《蒙娜丽莎》和《星夜》两幅目标图像(通过结构相似性SSIM评分),并完成五段文字提示(如“一位老渔夫在午后阳光下的脸”),共28幅画。

结果显示:在目标临摹中,GPT-5.6 Sol以平均SSIM 0.3740领先,其次是Gemini 3.6 Flash(0.3145)、Claude Fable 5(0.2442)和Grok 4.5(0.1864)。在成本方面,GPT-5.6每幅画平均花费0.16美元,时间不足1分钟;而Claude Fable 5每幅画平均耗时8分钟、花费高达0.17美元(但产出质量较低)。Grok 4.5表现最粗糙,甚至无法完成部分任务,而开源模型在该任务中几乎完全不可用。

为什么重要

这个实验不是简单的“画画比赛”,它砍向行业里两个敏感痛点。第一,它揭示了“前沿模型 vs 开放模型”的真实差距——许多开源模型在基准测试中刷分亮眼,但面对一张白纸、一套工具、一个模糊目标时,直接画出空白画布。这意味着,在实际需要模型自主规划、纠错和工具调用的应用场景里,前沿模型的“执行能力”壁垒依然很高。第二,它量化了“长耗时任务”的成本结构:Claude Fable 5虽然在其他任务(如音乐视频生成)上胜出,但在绘画任务中,其更长的推理时间和更高的花费带来了更差的结果,直接说明“越贵未必越好”,选模型必须看场景。

对用户/开发者/创作者的影响

对开发者:如果正在构建需要模型自主调用工具链(如绘图、编辑、设计助手)的产品,这个实验是一个重要的能力参考。GPT-5.6在工具调度、迭代修复和成本控制上表现出明显优势,而Claude Fable 5并非在所有多步骤任务中都值得更高的调用成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者:目前AI在“根据文字生成图像”方面已有成熟产品(如Midjourney),但“让AI一步步用工具画出图像、并能实时自我修正”仍处于早期。这意味着,在AI辅助精细设计和风格控制方面,高端闭源模型与廉价开源模型之间还有显著鸿沟。

对采购决策者:开源模型在批量执行上确实能替代部分前沿能力,但涉及需要模型多步骤规划、视觉反馈与自我纠正的场景,开源模型目前还不堪重用。Kimi K3等新开源模型即将发布,值得跟踪。

值得关注的后续

目前公开信息显示,值得关注三个方向:一是该评测团队已开放全部代码(GitHub),开发者可以自己拿目标图像或提示词运行测试,这会加速行业对模型工具调用能力的横向对比;二是Kimi K3开源后是否能在该任务中填补“开源 vs 前沿”的空白,将直接影响中小开发团队的技术选型;三是Claude Fable 5在绘画任务中表现不佳,但之前在音乐视频任务中胜出,说明“强模型”在不同工具链任务中的表现天差地别,厂商需要更细分的场景适配。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14563

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注