阿里国际站张阔:模型榜单接近满分,真实商业任务通过率仅约 61%
用 107 个真实外贸任务测出前沿模型无人干预通过率仅约 61%,说明榜单分数和实际交付之间的差距在哪、垂直产品靠什么补。
嘉宾张阔
节目简介
榜单成绩越来越好,为什么把工作真正交给 AI,还是需要人反复解释、检查和兜底?阿里国际站总裁张阔再次做客,聊商家使用 Accio Work 的真实案例:团队从实际业务中整理出 107 个任务,包括比供应商报价、识别钓鱼邮件、预订船期、处理交易纠纷,最前沿模型在无人干预下通过率约 61%。节目还讨论通用模型与垂直产品的竞争、多模型路由的成本取舍,以及人该保留哪些判断。