行业新闻

Genie Code 数据智能体准确率与成本优于通用编码智能体

Databricks 的数据智能体 Genie Code 通过语义搜索和记忆技术,在测试中实现更高准确率与更低成本,优于通用编码智能体。

传统观念认为更准确需更多 token。Databricks 在 400+ 真实数据任务中测试,其数据智能体 Genie Code 在准确率和成本上均优于三款通用编码智能体。原因在于 Genie Code 利用语义搜索和持久记忆,避免通用智能体随机探索导致的低效,从而以更低 token 消耗完成正确任务。

正文摘录

为什么前沿数据智能体在质量和成本上优于通用编码智能体 我们针对 Genie Code 与三款领先的编码智能体,在 400 多个来自真实内部会话的任务上进行了评估。 智能体 AI 的传统观点认为,更好的答案会消耗更多 token:让智能体探索更久、验证更多、重试更多,准确率总会提高。当我们在来自内部使用的 400 多个真实数据任务上,将 Genie Code 与三款领先的通用编码智能体进行直接对比评估时,我们发现恰恰相反:Genie Code 既是我们测试中准确率最高的智能体,也是成本效益最高的。 原因在于,数据智能体必须在一个通用编码智能体难以胜任的新范式中工作。正如我们之前分享的,数据智能体面临独特的挑战:它们必须在动态、不断变化的工作空间中发现正确的资产,这个空间包含数十万个表、笔记本、仪表盘和文档;它们必须从可能过时或矛盾的元数据和文档中确定真实来源;而且它们必须在没有编码智能体所依赖的可验证测试的情况下完成这一切。 为了应对这些挑战,我们为 Genie Code 提供了能力,使其能够跳过通用编码智能体所依赖的随机漫步探索:对目录和工作空间资产的语义搜索、用户所依赖的表和业务逻辑的持久记忆,以及对企业上下文的深度语义理解。 我们在本次评估的会话中直接观察到了这种差异。在一个例子中,Genie Code 利用语义搜索和元数据高效地找到了正确的表,编写了一条 SQL 查询,并在五次工具调用中得到了正确答案,而三款通用智能体没有一个能从探索中恢复。 下面,我们深入探讨如何在广泛真实的用户任务上评估 Genie Code。 我们特意构建了一个评估集,覆盖 Genie Code 上真实用户任务的广泛分布。

阅读原文(databricks.com)→

行业新闻2026-07-23原文

相关内容