不靠最强大模型,也能拿全球第一?OceanBase 的 “纯国产组合” 登顶国际 Data Agent 榜

OceanBase 团队以国产数据库加国产大模型 GLM-5.2 的组合,在国际数据智能体基准 DAB 上以 90.62% 准确率排名第一,成为首个突破 90% 的参评方案,成绩超过多项基于 GPT、Claude 系列构建的方案。

一句话看懂:OceanBase 团队以国产数据库加国产大模型 GLM-5.2 的组合,在国际数据智能体基准 DAB 上以 90.62% 准确率排名第一,成为首个突破 90% 的参评方案,成绩超过多项基于 GPT、Claude 系列构建的方案。

事件核心:发生了什么

近日,OceanBase 提交的 Data Agent 方案登顶国际数据智能体基准 Data Agent Benchmark(DAB),准确率达到 90.62%,位列榜首。该基准由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 合作推出,评测覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等领域,涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。

值得注意的是,这次参评方案基于国产数据库 OceanBase 与国产大模型 GLM-5.2 构建,内部代号 Scout,击败了多项采用 GPT、Claude Opus、Claude Fable 等海外模型搭建的 Data Agent 方案。相关能力后续将融入 OceanBase 的 AI 数据分析产品 DataPilot。

为什么重要

DAB 与传统 Text-to-SQL 评测的侧重点不同。后者主要考察模型能否把自然语言转成 SQL,而 DAB 更接近真实数据环境:Data Agent 需要在分散、异构的数据源中理解数据、选择数据、规划分析路径、完成查询计算,并验证结果是否可靠。它考验的是“模型+Agent+数据系统”的协同能力,而不是单一模型的跑分。

这也是此次成绩的含金量所在。在底层模型采用 GLM-5.2 的情况下,OceanBase 方案依靠 DataLens 数据画像、任务规划、证据追踪和答案校验,形成了“数据理解—规划执行—验证修复”的闭环。这说明国产数据库与国产大模型结合后,已经能够支撑复杂的数据分析任务,而不只是完成简单查询。

对用户/开发者/创作者的影响

对开发者和企业数据团队来说,这类方案的价值在于降低 AI 接入真实业务数据的门槛。过去让大模型直接查数据库,往往卡在表结构复杂、字段含义不清、结果不可靠等问题上。Data Agent 如果能把数据发现、关联计算和结果校验做成产品能力,开发者就不必从零搭建一套数据管道。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购方而言,OceanBase DataPilot 的方向意味着数据库厂商正在从“存储和查询”延伸到“帮 AI 用数据完成任务”。如果后续产品化顺利,企业在选择 AI 数据分析工具时,会多一个国产数据库加国产模型的组合选项。对内容创作者来说,这类能力暂时不直接相关,但它反映出一个趋势:AI 应用正在从生成内容走向处理真实业务数据。

值得关注的后续

第一,Scout 的相关能力何时真正落地到 OceanBase DataPilot,以及是否对外开放 API 或独立产品形态。第二,DAB 榜单上的其他方案是否会跟进类似的数据验证和修复机制,推动评测标准继续演化。第三,国产数据库与国产大模型的组合能否在更多真实企业场景中复现这一成绩,而不只是停留在基准测试中。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 24709

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注