Arena 更新 Image-to-WebDev 榜单:GPT-6 Astra 以 1733 分登顶

Arena 更新 Image-to-WebDev 榜单,四款新模型上榜,OpenAI 的 GPT-6 Astra(Max)以 1733 分登顶,比第二名高出 23 分;同时有三款模型进入性价比帕累托前沿,最低价格压到每百万 token 0.21 美元。

一句话看懂:Arena 更新 Image-to-WebDev 榜单,四款新模型上榜,OpenAI 的 GPT-6 Astra(Max)以 1733 分登顶,比第二名高出 23 分;同时有三款模型进入性价比帕累托前沿,最低价格压到每百万 token 0.21 美元。

事件核心:发生了什么

Arena 于 9 月 15 日更新 Image-to-WebDev Arena 榜单,新增四款模型。该榜单衡量模型从图片、截图生成网页的能力,同时覆盖多步推理与工具调用类的智能体编程工作流。本次排名如下:OpenAI 的 GPT-6 Astra(Max)以 1733 分位列第一,比 GPT-5.6 Sol(xHigh)高 129 分,比第二名高 23 分;Anthropic 的 Claude Fable 5.1(Max)以 1710 分位列第二,比 Fable 5 提升 87 分,比第三名的 Claude Opus 5(Max,1665 分)高 45 分;Meta 的 Muse Spark 1.3(Max)以 1645 分排在第四;智谱 Zai 的 GLM-5.3-Flash 以 1588 分排在第十。

值得单独拎出的是价格维度:Arena 按每百万 token 混合价格计算,GPT-6 Astra 为 1733 分 / 40 美元,Muse Spark 1.3 为 1645 分 / 3.5 美元,GLM-5.3-Flash 为 1588 分 / 0.21 美元。三者同时进入帕累托前沿,即在该榜单的“性能—成本”组合上暂无明显更优替代。

为什么重要

这个榜单把“视觉理解 + 前端代码生成 + 工具调用”放在同一个评测框架里,比单纯的代码补全或文本推理更贴近真实的 AI 应用开发场景。GPT-6 Astra 与 Claude Fable 5.1 的差距只有 23 分,说明头部闭源模型在图像到网页这一细分任务上的能力正在收敛;但价格差被拉开到两个数量级,意味着竞争重心从“谁更强”转向“谁在可接受成本下足够强”。Muse Spark 1.3 和 GLM-5.3-Flash 进入帕累托前沿,也说明开源或低价路线在智能体编程领域并非只能做陪跑。

对用户/开发者/创作者的影响

对开发者而言,图像转网页的 API 成本直接决定产品能否规模化。0.21 美元/百万 token 的 GLM-5.3-Flash 适合批量截图转页面、低代码原型生成等高吞吐场景;3.5 美元的 Muse Spark 1.3 在分数接近头部的情况下提供了中间档选择。对创作者和设计工具团队来说,截图生成可运行网页的能力正在从演示变成可接入的工作流,选型时需要同时看生成质量和调用成本,而不是只看榜首。企业采购则可能更关注模型是否支持稳定的多步工具调用,因为榜单本身包含这部分评测。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 GPT-6 Astra 与 Claude Fable 5.1 的分数接近,下一轮榜单更新是否会出现反超;二是 GLM-5.3-Flash 这类低价模型能否在真实项目中保持同等生成质量,目前公开信息显示其分数与头部仍有约 145 分差距;三是 Arena 是否会公开更细分的价格档位或任务类型,让选型判断更有依据。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 23743

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注