GPT-6.1 上线 Arena 评测平台

OpenAI 的新模型 GPT-6.1 已上线 Arena 评测平台,进入 Agent Arena 和 Code Arena 等多个测评赛道,用户投票将参与其评分;OpenAI 同时把它定位为接近 Astra 能力、但成本只有约五分之一的高性价比模型。

一句话看懂:OpenAI 的新模型 GPT-6.1 已上线 Arena 评测平台,进入 Agent Arena 和 Code Arena 等多个测评赛道,用户投票将参与其评分;OpenAI 同时把它定位为接近 Astra 能力、但成本只有约五分之一的高性价比模型。

事件核心:发生了什么

Arena(@arena)宣布,OpenAI 的 GPT-6.1 正式接入 Arena 评测体系,用户可前往 Agent Arena 实测,投票结果将影响该模型的评估分数,具体排名分数将稍后公布。Agent Arena 的测试对象是数百万个真实场景、长周期的智能体任务,模型可以调用网页搜索、文件系统和终端工具来完成复杂工作流;榜单采用因果追踪方法,衡量模型相对“平均水平模型”的结果表现。

除 Agent Arena 外,GPT-6.1 也同步进入 Code Arena 的多个方向,包括 WebDev、文本、视觉、搜索和文档。OpenAI 官方账号在推广中称其为 “GPT-6.1 Sol”,强调其具备接近 Astra 的智能水平,价格约为后者的五分之一,是当前同等性能下最具成本效率的模型。发布时间为 2026 年 9 月 29 日。

为什么重要

这次上线的看点不只是新模型,而是评测方式的信号。Agent Arena 用真实长周期任务、工具调用和因果追踪来打分,意味着行业对模型的评价正从“单轮问答”转向“能否把复杂工作真正做完”。这更贴近 AI 应用落地的实际需求,也更能区分模型在智能体场景中的真实能力。

另一个关键点是成本。OpenAI 把 GPT-6.1 的价格对标自家更高端模型,若“五分之一价格、接近 Astra 智能”的说法在第三方评测中站得住,闭源大模型的性价比竞争会进一步加剧,对开源模型和其他厂商的定价策略都会形成压力。

对用户/开发者/创作者的影响

对开发者来说,GPT-6.1 进入 Code Arena 的 WebDev、搜索和文档等赛道,意味着它可能适合承担代码生成、检索增强和文档处理等任务,是否值得接入 API、替换现有模型,可以等 Arena 分数和实际价格公布后再判断。对做 AI 应用和智能体的团队,Agent Arena 的工具调用评测结果会是一个更实用的参考指标。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和创作者,短期最直接的变化是可以在 Arena 上免费试用并投票,通过对比感知模型差异。目前公开信息显示,官方尚未给出完整定价细节和榜单成绩,实际使用成本与效果仍需验证。

值得关注的后续

一是 Arena 何时公布 GPT-6.1 在 Agent Arena 和 Code Arena 的具体分数,尤其是与 Astra 及其他竞品的差距;二是 GPT-6.1 的 API 定价、上下文长度和工具调用限制是否与“五分之一价格”的说法一致;三是其他厂商是否跟进降价或推出对标智能体评测的模型,以及用户投票是否会明显影响其排名。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 26314

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注