Supabase 发布 Evals:一个开源基准,用于在真实 Supabase 任务上评测 Claude Code、Codex 和 OpenCode

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

一句话看懂:Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力。

事件核心:发生了什么

据 MarkTechPost Research 报道,Supabase 于 2026 年 8 月发布 Evals——一个开源的 AI 编程基准测试。它从真实 Supabase 项目的日常开发任务中提取题目,让 Claude Code、Codex 和 OpenCode 在真实代码环境中执行,再对结果进行自动评分。区别于常见的“刷题式”评测,Evals 更看重多文件修改、数据库操作、API 调用等真实工程场景中的完成情况。目前公开信息显示,具体评分细则和任务数量尚未完整披露,但评测框架已经开源。

为什么重要

AI 编程代理是目前大模型应用中最活跃的方向之一,但各家产品的评测往往由厂商自行发布,缺乏统一、可复现的比较标准。Supabase 将自家

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 16407

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注