AI实验室在搞Pelicanmaxxing吗?

一位AI社区成员试图通过“鹈鹕骑自行车”的SVG图像生成测试来捉住AI实验室作弊,结果发现各模型在该任务上表现一致,没有明显特化。这揭示了AI基准测试的博弈困境:当某个新颖的测试任务走红后,实验室可能专门优化它,而真正的能力提升反而被忽视。

AI实验室在搞Pelicanmaxxing吗?

一句话看懂:一位AI社区成员试图通过“鹈鹕骑自行车”的SVG图像生成测试来捉住AI实验室作弊,结果发现各模型在该任务上表现一致,没有明显特化。这揭示了AI基准测试的博弈困境:当某个新颖的测试任务走红后,实验室可能专门优化它,而真正的能力提升反而被忽视。

事件核心:发生了什么

IT从业者Dylan使用一种比以往更严谨的方法——为8种动物与6种交通工具(8×6组合)分别生成1008个SVG图像——来检验AI实验室是否在“鹈鹕骑自行车”这个特定图像生成任务上做了特殊调优。结论是:没有发现任何模型在该组合上的表现显著优于其他组合。这个测试的发起者最初的想法是,如果真能抓到某个实验室在这个“愚蠢的基准测试”上作弊,会是非常好笑的事情。因为用大模型生成复杂的SVG本是一个相对小众的应用,它考验的是模型的通用编程能力与空间知识,而不是专门的图像生成能力。

事实上,类似的现象在AI领域并非首次出现。有评论者联想到当年TPC(事务处理性能委员会)的SQL基准测试:如果在标准测试上表现不好,团队能力就被质疑;表现好才有资格进入客户的进一步筛选。但一个关键教训是,不能狭隘地过度优化单一场景而忽略相邻问题——比如当年显卡厂商针对“Quack3”基准测试的针对性优化。

为什么重要

这件事暴露了AI基准测试中日益严重的问题。随着AI大模型的能力快速提升,评估体系变得愈发脆弱。当一个新颖的测试任务在社交媒体或行业交流中走红后(比如这个“鹈鹕骑自行车”),参与的AI实验室很可能会不自觉地投入资源进行针对性训练或微调,从而导致该任务的分数失真。这不是纯粹的能力进步,而是对“考试范围”的适应。

知名AI开发者Simon Willison被调侃为“鹈鹕几何训练数据集的倡导者”——这暗示了开发者社区对这类“钻空子”行为的戏谑与担忧。如果每个实验室都针对走红的单项基准测试做局部优化,那么这些基准测试就失去了衡量大模型真实通用能力的意义,加剧了技术评估的噪音和群体性的错觉。

对用户/开发者/创作者的影响

对于普通用户和创作者来说,这一事件提醒:不要盲目相信单一基准测试的分数。一个模型可能在“鹈鹕骑自行车”测试中得分很高,但这并不代表它在生成其他动物或物体(比如鳄鱼或卡车)的SVG图像时同样出色。实际上,当前的SVG图像生成整体上仍然“丑得令人难以直视”,准确地绘制物体是一回事,生成让人愿意使用的美观结果是另一回事。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于开发者和研究人员,这是一个关于基准测试设计的警示:基准测试应该足够广泛、稳健,并且持续更新,以避免被模型“记住”或针对性地优化。同时,评估一个模型时,需要结合多种任务和场景,而非依赖一两个流行指标。那些看似能区分模型能力的“新颖基准”,其保质期可能比你想象的短得多。

对于企业采购决策者,在评估AI大模型供应商时,应该要求供应商提供跨多个非相关任务的、未经专门优化的结果,并要求提供详细的测试方法说明,避免被单一任务的亮眼表现所迷惑。

值得关注的后续

第一,基准测试“军备竞赛”是否会升级? 为了避免模型针对特定任务做微调,社区可能会设计动态更新的、随机组合的测试集,或者引入对抗性测试方法——即故意隐藏部分测试内容。第二,Simon Willison的“戏言”是否会成真? 已经有开发者戏谑地表示,“鹈鹕几何”可能会真正进入某些实验室的细调数据集,这本身就是对当前行业风气的一种反讽。第三,SVG图像生成能力的实际进步 或许是个更值得跟踪的指标——如果大模型能真正从视觉理解和空间推理层面提升SVG生成能力,那么它的通用智能必然也会同步提升,而非仅仅在这个“奇怪的边缘用例”上表现优异。

来源:hackernews

celebrityanime
celebrityanime
文章: 14761

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注