行业新闻

阿里获ACL 2026最佳资源论文奖 提出Agent评测新基准

阿里获ACL 2026最佳资源论文奖 提出Agent评测新基准

阿里新研究揭示当前AI Agent在复杂规则推理中准确率远低于人类,并提出新基准HSCodeComp,指明架构瓶颈而非算力问题。

阿里研究团队在ACL 2026上获最佳资源论文奖,提出Agent评测新基准HSCodeComp。测试发现,最强Agent在海关编码分类任务上准确率仅45%,远低于人类专家的95%,且增加推理时间无法缩小差距。根本原因在于推理链过长、领域知识不足和推理幻觉,而非算力问题。

正文摘录

阿里斩获国际 AI 顶会最佳资源论文奖,提出 Agent 评测新范式 7月8日,国际 AI 顶级学术会议 ACL 2026 公布了最佳论文奖项,阿里研究团队在 Deep Research Agent 方向的研究成果从全球一万多篇投稿中脱颖而出,获评最佳资源论文奖(Best Resource Paper),是国内唯一获得该奖项的中国公司。据悉,该论文首次系统揭示了当前 Agent 在真实世界复杂规则推理中面临巨大缺陷,并提出了全新的专家 Agent 评测基准,为提升大模型在真实场景的可靠性指明了新方向。 ACL(国际计算语言学协会)成立于1962年,是自然语言处理和计算语言学领域中历史最悠久、最具权威性的国际学术组织。在学术评价体系中,ACL 长期位居谷歌学术计算语言学子领域的 h5-index 影响力榜首,是大模型、Agent 等前沿计技术的核心论文首发阵地。据介绍,ACL 2026 共收到12148篇投稿,仅19%被主会录用,最终仅有4篇论文获评 Best Resource Paper。 阿里此次获奖的论文以商品出口所需的10位海关编码(HS Code)为切入点,提出了针对真实场景和专家水平的智能体新基准 HSCodeComp,它要求 Agent 像资深关务专家一样,将商品模糊的属性与严格的关税归类规则对齐,为商品精准映射到10位细分编码。研究团队对14个主流大模型和9个先进 Agent 框架进行了全面评测。测试结果显示,表现最好的 Agent 系统准确率仅为45%左右,远低于人类专家95%的准确率。更值得注意的是,研究还发现单纯堆更多推理时间(inference-time scaling)并不能显著缩小这道鸿沟,这意味着这背后并非“算力问题”,而是 Agent 架构本身的结构性瓶颈。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-08原文

相关内容