用GPT-5.6、Claude、Gemini和Grok“画”出蒙娜丽莎

Hacker News 用户发起了一场非正式测评,要求 GPT-5.6(传闻中的 OpenAI 下一代模型)、Claude、Gemini 和 Grok 分别“画”出蒙娜丽莎,结果各模型输出质量差异巨大,引发了对不同模型训练与推理机制差异的讨论。这一测试虽不严肃,却揭示了当前多模态模型在关键基准之外的“隐形差距…

用GPT-5.6、Claude、Gemini和Grok“画”出蒙娜丽莎

一句话看懂:Hacker News 用户发起了一场非正式测评,要求 GPT-5.6(传闻中的 OpenAI 下一代模型)、Claude、Gemini 和 Grok 分别“画”出蒙娜丽莎,结果各模型输出质量差异巨大,引发了对不同模型训练与推理机制差异的讨论。这一测试虽不严肃,却揭示了当前多模态模型在关键基准之外的“隐形差距”。

事件核心:发生了什么

一名开发者使用公开试用工具 TryAI.dev,向四款主流大模型——传闻中的 OpenAI 新模型(被社区戏称为 GPT-5.6)、Anthropic 的 Claude、Google 的 Gemini 以及 xAI 的 Grok——发出了同样的指令:“用 ASCII 或文本艺术形式画出蒙娜丽莎”。测试结果在 Hacker News 上引发热议。用户普遍反映,其中某款模型的输出在结构比例、细节还原和艺术感知上明显弱于其他几款。发起者指出,这种差异“不仅仅是技术落后那么简单”,并猜测可能涉及“训练方式或推理管道上的根本性不同”。目前尚不清楚具体是哪款模型表现较弱,也没有官方数据支撑。

为什么重要

这个看似娱乐化的横向对比,实际上触及了当前 AI 模型竞争的三个关键维度。第一,多模态理解能力的“隐形割裂”:文本生成、图像理解与抽象任务(如将视觉名作转化为文本构图)对模型的推理路径要求不同,即便在基础基准测试中分数接近,实际表现也可能天差地别。第二,训练策略的分歧:闭源模型是否存在训练数据分布偏差或对“创意指令”的适应能力不足,将直接影响工具型产品的用户体验。第三,社区对“下一代模型”(如传闻中的 GPT-5.6)的预期尚未建立,任何非官方测试都会被放大为对技术路线选择(通用强化 vs. 专用优化)的隐忧。

对用户/开发者/创作者的影响

对普通用户而言,这次测试的警示在于:不要轻信单一基准或官方演示,在具体创作任务(如文本转艺术、草图生成、风格迁移)中应实际动手对比。对开发者和创作者而言,选择 API 或集成模型时,需额外关注模型对“抽象指令”的还原能力,而非仅看该模型在传统 NLP 或视觉任务上的得分。目前公开信息显示,没有模型公开官方针对“文本艺术创作”的专项优化,这意味着创作者可能需要额外写 Prompt 模板来弥补某些模型的隐含弱点。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,如果 GPT-5.6 正式发布后仍在此类非标准测试中表现分化,会否促使 OpenAI 调整其训练数据中“创造性输出”的权重?第二,xAI 和 Anthropic 是否会推出针对“符号化艺术理解”的专项更新,以回应社区质疑。第三,TryAI.dev 这类引导用户“逼问模型弱点”的测试工具,是否会催生更多非官方、低成本的“隐蔽基准”,从而影响开发者选型决策。

来源:hackernews

celebrityanime
celebrityanime
文章: 14558

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注