阿里获ACL 2026最佳资源论文奖,揭示AI Agent在专家级规则应用中的能力鸿沟
阿里新基准HSCodeComp发现最强AI Agent在专家级海关编码任务上准确率不到人类一半,揭示层级规则应用的关键短板。
阿里巴巴ATH-MaaS团队构建HSCodeComp基准,测试AI Agent为商品申报海关编码(HS Code)的能力。结果显示最佳系统正确率仅49.4%,而十年经验人类专家达95%,暴露AI在层级规则应用上的盲区。该研究获ACL 2026最佳资源论文奖。
正文摘录
.jpg)  过去一年,Deep Research Agent 被视为大模型落地的下一个突破口,它们会检索、能用工具、可多步推理,在一个个榜单上高歌猛进。但把它们放到真实世界的专业场景里,表现是否也同样亮眼? 先从一个每天都在发生、却少有人细想的问题说起:每一笔跨境货物通关,都必须先回答一个看似不起眼、却牵动巨大利益的问题:这件商品的海关编码(HS Code,商品名称及编码协调制度)是什么?这串编码是支撑全球每年约 26 万亿美元贸易的商品「唯一数字身份证」,直接决定关税计算与合规成败。如果报错,轻则多缴税款,重则货物滞留、触发合规风险。 那么,如果让今天最强的一批 AI Agent 去做这件跨境电商关务专员每天都在做的工作:给一件商品报出正确的海关编码,结果会怎样? 答案可能出乎意料: 表现最好的系统也只能做对约 49.4%,而一位从业十年的人类专家能达到 95% 。 这道接近腰斩的差距背后,藏着当前 AI Agent 一块被长期忽视的能力盲区, 面对人类专家编写的层级规则,先进的 Deep Search Agent 集体「失灵」了 。