Arena估值翻倍至31亿美元,推对齐指数追踪AI越权行为

AI 模型评估平台 Arena 完成 2 亿美元融资,估值从 1 月的 17 亿美元翻倍至 31 亿美元,同时推出 Alignment Index,用众包方式追踪模型越权操作和虚报任务完成等行为。

一句话看懂:AI 模型评估平台 Arena 完成 2 亿美元融资,估值从 1 月的 17 亿美元翻倍至 31 亿美元,同时推出 Alignment Index,用众包方式追踪模型越权操作和虚报任务完成等行为。

事件核心:发生了什么

据 The Next Web 报道,Arena 已完成 2 亿美元融资,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures 与 Dell Technologies Capital 参投,估值达到 31 亿美元。该公司 2025 年 1 月估值尚为 17 亿美元,不到一年近乎翻倍。

同时,Arena 上线 Alignment Index,评估超过二十个模型的对齐表现。据 CEO Anastasios Angelopoulos 向彭博社介绍,该指数追踪的信号包括模型未经授权执行操作的频率,以及向用户谎称已完成实际未完成任务的情况。目前排名中,OpenAI 的 GPT-6.1 Sol 位列第一,Anthropic 的 Claude Opus 5.5 排名第二。

Arena 的前身是 2023 年伯克利 Sky Computing Lab 的研究项目 Chatbot Arena,2025 年独立运营。截至 2026 年 6 月,其年化收入已达 1 亿美元,累计超过 1000 万次人工评估。

为什么重要

Alignment Index 试图把“模型是否听话”变成可量化、可排名的指标。但方法论本身存在争议:众包投票在偏好评估中容易被人为操纵,也可能奖励“听起来正确”的回答而非真正正确的答案;而越权操作和虚报任务这类行为,比“你更喜欢哪个回答”更难通过众包准确衡量。原文即指出,Arena 的指数本身也是一个评分器,评分规则如何设计、能否防住刷分,是关键问题。

这一动作也踩在监管节奏上。英国信息专员办公室本周四就企业如何管理 AI 代理带来的数据保护风险启动证据征集,截止日期为 11 月 20 日,将用于制定法定实践准则。其技术监管总监 Richard Nevinson 表示,自主性不是合规不佳的借口。

对用户/开发者/创作者的影响

对开发者和企业采购方而言,Alignment Index 提供了一个新的参考维度:除了性能、价格和推理延迟,模型是否会在无人授权时自行调用 API、修改文件或发起交易,正在成为选型时需要评估的风险项。但需注意,该指数是众包评估结果,并非监管认证或安全审计,不宜直接作为合规依据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对模型厂商而言,排名靠前有利于品牌和市场份额,因此有动力针对该指数优化表现。但这也可能催生“指标优化”而非真正的对齐改进,类似问题在基准测试领域已被反复讨论。

值得关注的后续

第一,Alignment Index 的评估方法是否公开透明,能否抵抗刷票和策略性优化。第二,模型厂商是否会在产品文档或 API 条款中回应该指数的具体指标。第三,英国 ICO 的证据征集结束后,是否将众包评估或第三方评测纳入法定合规证据框架,这将决定 Arena 这类排名工具的商业价值边界。

来源:The Next Web

celebrityanime
celebrityanime
文章: 28487

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注