行业新闻

阿里获ACL 2026最佳资源论文奖,揭示AI Agent在专家级规则应用中的能力鸿沟

阿里新基准HSCodeComp发现最强AI Agent在专家级海关编码任务上准确率不到人类一半,揭示层级规则应用的关键短板。

阿里巴巴ATH-MaaS团队构建HSCodeComp基准,测试AI Agent为商品申报海关编码(HS Code)的能力。结果显示最佳系统正确率仅49.4%,而十年经验人类专家达95%,暴露AI在层级规则应用上的盲区。该研究获ACL 2026最佳资源论文奖。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c737c77e-17af-4e10-9f17-5af2b59a64e9/010(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 过去一年,Deep Research Agent 被视为大模型落地的下一个突破口,它们会检索、能用工具、可多步推理,在一个个榜单上高歌猛进。但把它们放到真实世界的专业场景里,表现是否也同样亮眼? 先从一个每天都在发生、却少有人细想的问题说起:每一笔跨境货物通关,都必须先回答一个看似不起眼、却牵动巨大利益的问题:这件商品的海关编码(HS Code,商品名称及编码协调制度)是什么?这串编码是支撑全球每年约 26 万亿美元贸易的商品「唯一数字身份证」,直接决定关税计算与合规成败。如果报错,轻则多缴税款,重则货物滞留、触发合规风险。 那么,如果让今天最强的一批 AI Agent 去做这件跨境电商关务专员每天都在做的工作:给一件商品报出正确的海关编码,结果会怎样? 答案可能出乎意料: 表现最好的系统也只能做对约 49.4%,而一位从业十年的人类专家能达到 95% 。 这道接近腰斩的差距背后,藏着当前 AI Agent 一块被长期忽视的能力盲区, 面对人类专家编写的层级规则,先进的 Deep Search Agent 集体「失灵」了 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-19原文

相关内容