AI排行榜Arena估值10个月翻倍至31亿美元,推出对齐榜单

以众包模型评测起家的 Arena 完成 2 亿美元 B 轮融资,估值升至 31 亿美元,并新增“对齐”排行榜,试图在模型能力与真实表现脱节的争议中扮演中立评测方。

一句话看懂:以众包模型评测起家的 Arena 完成 2 亿美元 B 轮融资,估值升至 31 亿美元,并新增“对齐”排行榜,试图在模型能力与真实表现脱节的争议中扮演中立评测方。

事件核心:发生了什么

Arena 于 10 月 8 日宣布完成 2 亿美元 B 轮融资,投后估值 31 亿美元。本轮由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等参与。公司 1 月完成 1.5 亿美元 A 轮时估值为 17 亿美元,当时年化收入约 3000 万美元;6 月其年化收入达到 1 亿美元。按公开数据计算,约 10 个月估值接近翻倍。

Arena 起源于 2023 年 UC Berkeley 的一个研究项目,用户输入提示词后对多个模型的回答进行盲评,平台称月访问量达数千万。2025 年 9 月,它推出面向模型实验室和企业的商业产品 AI Evaluations,提供基于社区反馈的性能分析。此次融资同时,Arena 在排行榜中新增“对齐”类别,按未经授权行动、错误归因、虚假完成等维度对模型排序。目前公开信息显示,OpenAI 多款模型在其初步对齐榜单中排名靠前,Claude Opus 5.5 和 Claude Fable 分列第六和第九。

为什么重要

静态基准测试容易被模型“刷分”,这已是行业公开问题。模型实验室开始意识到,仅靠标准化考试式评测无法反映模型在真实使用中的行为;企业则更关心某个模型是否适合自己的内部任务,而不是通用榜单上的绝对分差。Arena 的商业逻辑正建立在“社区投票 + 商业分析”的组合上:免费众包评测获取规模和多样性,再向模型方和企业出售细粒度报告。本轮融资表明,评测环节正在从公益项目变成可规模化的生意。

对用户/开发者/创作者的影响

对开发者而言,Arena 的众包结果可作为模型选型的参考,但不宜直接当作生产环境结论。免费榜单覆盖的是大众任务分布,AI Evaluations 更贴近企业定制需求;如果团队在意合规、安全性或特定垂直场景,仍需要自建测试集。对内容创作者和普通用户,新增对齐榜单提供了观察模型“乱操作”“甩锅”“谎报完成”等行为的窗口,但当前排名仍是初步结果,受时间、任务和投票人群限制,不能理解为永久排名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是对齐榜单的评测方法是否公开透明,以及模型厂商是否会针对该榜单优化行为;二是 AI Evaluations 能否在模型实验室和企业采购中形成稳定付费,支撑当前估值;三是社区众包评测与商业化报告之间如何保持中立,避免利益冲突影响公信力。

来源:TechCrunch AI

celebrityanime
celebrityanime
文章: 28487

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注