我个人的 AI 基准:“生成带有哈布斯堡下巴的青蛙的 SVG。”

一位开发者用“生成带有哈布斯堡下巴的青蛙SVG”作为测试AI的基准,让 Claude Opus 5 在代码层面还原一个具体的解剖学特征,以此检验模型对指令的理解力和细节把控力。这件事之所以值得关注,是因为它提供了一种低成本的、可验证的模型评估方式,和常规跑分或人工看图评价形成补充。

一句话看懂:一位开发者用“生成带有哈布斯堡下巴的青蛙SVG”作为测试AI的基准,让 Claude Opus 5 在代码层面还原一个具体的解剖学特征,以此检验模型对指令的理解力和细节把控力。这件事之所以值得关注,是因为它提供了一种低成本的、可验证的模型评估方式,和常规跑分或人工看图评价形成补充。

事件核心:发生了什么

在 frogs.vaguespac.es 这个个人项目中,作者把“生成带有哈布斯堡下巴的青蛙的 SVG”当作衡量 AI 能力的测试题,连续运行了三次 Anthropic 旗下的 Claude Opus 5 模型。页面公开信息显示,该测试于 2026 年 8 月 2 日进行,三次运行分别耗时 64.0 秒、42.0 秒,以及另一次未完整展示的运行。

哈布斯堡下巴指下颚前突、下唇明显突出的面部特征。测试的关键不在“画一只青蛙”,而在于模型是否真的理解这个罕见的解剖学概念。从结果来看,模型生成的 SVG 代码中确实出现了专门描述下颚的注释,例如“巨大的突出下颌骨”(HUGE protruding Habsburg jaw),并用路径绘制了前突的下巴、包住上唇的下排牙齿,以及“下垂的尊贵眼皮”等结构。这意味着模型在代码层面做了解剖结构的拆解,而不是简单地画出一张像素图。

为什么重要

这个测试的价值在于它把图像生成问题转换成了代码生成问题。SVG 是文本形式的矢量图,生成的每一根线条、每一个路径都可以被检查、被验证。相比“生成一张猫的照片”这类难以量化好坏的任务,“画一只哈布斯堡下巴的青蛙”有明确的事实检验标准——下巴是否真的前突、牙齿是否真的越过上唇。这种思路为判断大模型的推理能力提供了新的观察窗口:模型不仅要“知道”哈布斯堡下巴长什么样,还要把它翻译成可执行的坐标和路径,这对指令跟随、视觉理解和结构推理都提出了比一般对话更高的要求。目前公开信息显示,这类个人化测试尚未形成系统评分,但它展示了闭源模型在复杂指令下的实际表现边界,也侧面说明了评估 AI 不能只依赖传统榜单。

对用户/开发者/创作者的影响

对开发者而言,这是一个可以借鉴的轻量评估方法:用一段可验证的 SVG 或代码生成任务,就能快速测试模型对具体概念的掌握程度和指令遵循能力,不需要搭建复杂的评测环境。对创作者来说,这个案例展示了 AI 图像生成的一个新方向——直接产出可编辑的矢量代码,而不是位图。SVG 可以无损缩放、可以改颜色、可以提取图层,适合用在网页、插画和界面设计里,这意味着工作流可控性更强。对普通用户来说,这件事的启示很简单:描述越具体、越带有确切特征的任务,越能看出一个模型是真正理解问题,还是在用训练数据中的套路应付回答。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

后续可以观察三点:第一,这个个人测试是否会被扩展成多人参与、多模型对比的公开基准,如果可以做,它可能成为社区认可的轻量评测工具;第二,Claude Opus 5 以及其他同类模型在更新后,能否在同样的题面上稳定输出符合解剖学逻辑的代码,这能反映模型推理能力的持续进步情况;第三,这类“视觉概念转代码”的能力是否会进入实际的 API 和产品场景,例如让用户通过一句话直接生成可编辑的设计稿,这将直接影响依赖设计资源的团队的工作方式。

来源:Hacker News

celebrityanime
celebrityanime
文章: 16585

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注