登顶国际Data Agent榜单,OceanBase超过多项GPT、Claude方案

OceanBase 团队以内部代号 Scout 的 Data Agent 方案,在国际 Data Agent Benchmark(DAB)上取得 90.62% 准确率并排名第一,成为该榜单首个突破 90% 的提交。更值得关注的是,它使用国产大模型 GLM-5.2,超过了多个基于 GPT、Claude Opus…

一句话看懂:OceanBase 团队以内部代号 Scout 的 Data Agent 方案,在国际 Data Agent Benchmark(DAB)上取得 90.62% 准确率并排名第一,成为该榜单首个突破 90% 的提交。更值得关注的是,它使用国产大模型 GLM-5.2,超过了多个基于 GPT、Claude Opus 和 Claude Fable 构建的方案。

事件核心:发生了什么

据 AIbase 报道,OceanBase 的 Data Agent 方案近日登顶国际 Data Agent Benchmark(DAB),准确率达到 90.62%,位列第一。该评测由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 联合发起,覆盖互联网/本地生活、金融股票、生物医药、知识产权、企业运营、政府公共管理、媒体娱乐等多个领域,涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。

与传统 Text-to-SQL 主要考察“自然语言转 SQL”不同,DAB 更接近真实环境下的完整任务链:Data Agent 需要先理解数据、选择数据、规划分析路径,再执行查询与计算,最后验证结果。OceanBase 这次的提交代号为 Scout,技术上采用 DataLens 构建数据画像,再根据任务复杂度规划执行路径,并通过证据追踪与答案校验形成“理解—规划—验证—修复”的闭环。相关能力后续将整合进 OceanBase DataPilot。

为什么重要

DAB 考的并不只是底层模型,而是“模型 + Agent + 数据系统”的协同能力。模型负责理解与推理,Agent 负责任务规划与执行,数据系统负责数据发现、关联计算和结果验证。OceanBase 用 GLM-5.2 作为底层模型拿下第一,说明在复杂数据分析这类企业级场景中,国产数据库加国产模型的组合具备实际竞争力,而非停留在简单问答或演示层面。

对数据库行业来说,这释放了一个明确信号:当 AI Agent 成为数据的新使用者,数据库的角色正在从“把数据交给 AI”转向“帮助 AI 用好数据”。OceanBase 从数据库向 AI 数据平台演进,DataPilot 正是面向 AI 数据分析场景的产品方向,这次榜单成绩可以看作其 AI 能力的一次外部验证。

对用户/开发者/创作者的影响

对开发者和数据团队而言,DAB 的评测维度更贴近真实业务:跨库、跨领域、需要多步推理和结果校验。若 DataPilot 后续落地,可能降低企业搭建数据分析 Agent 的门槛,减少在提示词、数据关联和结果验证上的重复工程。对企业采购来说,国产数据库与国产模型的组合提供了新的选型参考,尤其在数据合规和本地化部署要求较高的场景。对内容创作者和普通用户,这类能力的直接体感可能来自更“能查数、会算数”的 AI 助手,而不是只会生成文本的聊天机器人。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Scout 的技术能力将并入 DataPilot,但具体上线时间、开放方式和定价尚未披露。后续可观察三点:一是 DataPilot 能否从评测榜单走向真实企业工作流;二是 GPT、Claude 系方案及其他数据库厂商是否会在 DAB 或类似基准上跟进回应;三是国产模型与数据库的协同方案,能否在开源生态和 API 层面形成更完整的开发者工具链。

来源:AIbase

celebrityanime
celebrityanime
文章: 24709

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注