国产数据库跑出AI新能力!
OceanBase登顶国际Data Agent榜单 OceanBase团队提交的Data Agent方案登顶国际数据智能体基准Data Agent Benchmark 近日, OceanBase团队提交的Data Agent方案登顶国际数据智能体基准Data Agent Benchmark(简称DAB),以90.62%的准确率位列第一,成为该榜单首个准确率突破90%的参评方案。
值得关注的是,这一成绩由国产数据库OceanBase基于国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型构建的Data Agent方案。
本次参评方案内部代号为Scout,相关能力将融入OceanBase DataPilot。
(图说:OceanBase登顶国际Data Agent榜单,成为首个准确率突破90%的参评方案) DAB由UC Berkeley EPIC Data Lab与Hasura PromptQL合作推出,评测覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等多个领域,并涉及PostgreSQL、MongoDB、SQLite、DuckDB等多种数据库。
与传统Text-to-SQL主要考察AI能否将自然语言转换成SQL不同,DAB更关注AI进入真实数据环境后,能否从复杂、分散、形态各异的数据中找到正确答案。
一个完整任务中,Data Agent需要理解数据、选择数据、规划分析路径、完成查询计算,并对结果进行验证,考验的是从“理解数据”到“拿到答案”的完整能力。
也正因此,DAB考验的不只是底层模型,而是“模型+Agent+数据系统”的综合能力。
模型负责理解和推理,Agent负责规划和执行,数据系统则要支撑数据发现、关联计算和结果校验。
三者能否协同,直接影响AI能不能真正把企业数据用起来。
OceanBase此次参评方案,正是围绕这一能力构建。
系统通过DataLens构建数据画像,识别字段和数据关系;再根据任务复杂程度规划执行路径,完成数据选择、筛选、关联和计算;得到结果后,还会通过证据追踪和答案校验检查计算过程和结果,发现问题时调整方案并重新验证,形成“数据理解—规划执行—验证修复”的闭环。
这也解释了此次90.62%成绩的含金量:它不是单纯证明国产模型能够完成数据查询,而是验证了国产数据库与国产模型结合后,能够共同支撑复杂的数据分析任务。
在底层模型采用GLM-5.2的情况下,OceanBase方案最终超过了多项采用GPT、Claude Opus、Claude Fable等海外模型构建的Data Agent方案。
对OceanBase而言,这也是其AI能力的一次新验证。
🔗 原始来源
如果你要核对细节,可以再看原文: 量子位原文链接
AI热榜