Arena 更新 Image-to-WebDev 榜单:GPT-6 Astra 以 1733 分登顶

Arena 更新 Image-to-WebDev 榜单,OpenAI 的 GPT-6 Astra 以 1733 分登顶,领先第二名 23 分;同时有三款模型进入性价比前沿,其中 GLM-5.3-Flash 以每百万 token 0.21 美元的价格拿到 1588 分。

一句话看懂:Arena 更新 Image-to-WebDev 榜单,OpenAI 的 GPT-6 Astra 以 1733 分登顶,领先第二名 23 分;同时有三款模型进入性价比前沿,其中 GLM-5.3-Flash 以每百万 token 0.21 美元的价格拿到 1588 分。

事件核心:发生了什么

Arena.ai 在 9 月 15 日更新了 Image-to-WebDev Arena 榜单,该榜单评估模型从图像、截图生成网站的能力,也覆盖多步推理和工具调用等智能体编程工作流。本次有四款新模型进入评测:OpenAI 的 GPT-6 Astra(Max)以 1733 分排名第一,比同门 GPT-5.6 Sol(xHigh)高出 129 分,比第二名高 23 分;Anthropic 的 Claude Fable 5.1(Max)以 1710 分位列第二,较 Fable 5 提升 87 分,比第三名 Claude Opus 5(Max,1665 分)高 45 分;Meta 的 Muse Spark 1.3(Max)以 1645 分排第四;智谱的 GLM-5.3-Flash 以 1588 分排第十。

为什么重要

这次更新透露两个信号。一是头部模型在“图像到网页”这一具体任务上的分数仍在拉开差距,说明多模态理解与代码生成结合的工程能力还有提升空间。二是性价比维度开始独立成一条竞争线:Arena 按混合价格计算,GPT-6 Astra 是 40 美元/百万 token 换 1733 分,Muse Spark 1.3 是 3.5 美元换 1645 分,GLM-5.3-Flash 则是 0.21 美元换 1588 分。后三者进入 Pareto 前沿,意味着高价不再等于唯一选择,闭源与开源、旗舰与轻量模型之间的定位正在被价格重新划分。

对用户/开发者/创作者的影响

对开发者和团队来说,榜单传递的信息很直接:如果做截图转页面的原型工具或低代码产品,GLM-5.3-Flash 这类低价模型已经能在接近第一梯队的分数上跑量,适合先做大规模试验;对外交付质量要求高的场景,再考虑 GPT-6 Astra 或 Claude Fable 5.1。目前公开信息显示,该榜单只反映图像转网页和智能体编程任务,并不代表模型在通用对话、长文本推理等方向的表现,采购和调用时仍需结合自己的评测集。对创作者而言,截图生成可交互页面的门槛继续降低,从设计稿到可上线网页的路径会更快,但生成结果的稳定性仍取决于模型选择和工程封装。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 GPT-6 Astra 与 Claude Fable 5.1 的分数差距只有 23 分,下一次榜单更新是否会被反超值得观察。二是 GLM-5.3-Flash 的价格优势能否在实际 API 调用中兑现,包括限流、延迟和工具调用稳定性。三是 Image-to-WebDev 这类细分榜单会不会成为厂商发布新模型时的标配评测项,进而影响模型的定价和开源策略。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 23680

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注