Epoch AI 解读 Remote Labor Index 基准

Epoch AI 解读了由 Center for AI Safety 与 Scale AI 共建的 Remote Labor Index(RLI)基准,它用真实付费外包项目衡量 AI 智能体能否端到端交付可被专业验收的工作,目前成绩仍在个位数低段。

一句话看懂:Epoch AI 解读了由 Center for AI Safety 与 Scale AI 共建的 Remote Labor Index(RLI)基准,它用真实付费外包项目衡量 AI 智能体能否端到端交付可被专业验收的工作,目前成绩仍在个位数低段。

事件核心:发生了什么

RLI 是一个面向 AI 智能体的评测基准,由 Center for AI Safety 和 Scale AI 制作,Epoch AI 在其评测页面汇总并解读公开榜单结果。它不采用人工设计的题目,而是直接抽取自由职业市场上的真实委托,覆盖软件开发、设计、建筑、数据分析、游戏开发、视频动画等 23 个外包领域,共 240 个可独立完成的项目。

按公开数据,这些项目合计代表超过 6000 小时的专业工作,市场价值超过 14 万美元。评测方式是一个智能体从头到尾完成整个项目,交付物按“人类专业受托方应达到的标准”来判定。核心指标是自动化率,即达到专业验收标准的项目占比,目前分数很低,处在个位数低段。

为什么重要

过去不少 AI 基准考的是模型能不能答对题,RLI 考的是能不能交付可收款的工作成果。这使它的分数更接近 AI 在真实劳动力市场中的替代或辅助能力,而不是聊天体验或考试能力。对企业采购和投资判断来说,这类指标比通用榜单更能说明 AI 应用能否嵌入实际生产流程。

同时,个位数低段的自动化率也提示,尽管大模型在代码生成、图像生成等单点任务上表现亮眼,但把它们串成端到端外包交付,仍受制于长链路推理、工具调用、自我校验和多轮修改。对算力和推理成本敏感的团队来说,这意味着短期内更现实的路线是人机协作,而非完全自动化。

对用户/开发者/创作者的影响

对开发者与 AI 应用团队,RLI 给出了一个可参考的评测方向:如果要做面向外包场景的智能体产品,需要关注任务拆解、API 调用、结果验证与交付格式,而不只是模型本身跑分。对设计、动画、数据分析等创作者,短期内更可能看到 AI 作为提效工具进入工作流,而不是直接取代委托关系。对企业采购方,RLI 的自动化率可作为判断某类外包任务能否交给 AI 的参考,但不宜把它等同于全面替代能力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 RLI 榜单分数是否随新一代大模型和智能体框架更新而明显上升;二是这些项目是否会向开源模型与闭源模型出现分化;三是评测标准是否会被行业进一步引用于定价、外包交付和合规判断。目前公开信息显示,RLI 仍以榜单和论文形式存在,尚无直接配套的商业产品发布。

来源:Epoch AI:研究、数据与评测

celebrityanime
celebrityanime
文章: 27123

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注