openJiuwen 发布自演进模型路由 X-Router,实测 Token 消耗降 50%
openJiuwen 发布可演进的模型路由引擎,把选模型从配置表变成动态决策,PinchBench 实测 Token 消耗降 50% 以上。
不是所有任务都需要最强的模型。openJiuwen(华为等联合构建的开源 AI Agent 平台)在 Agent 与模型之间加了一层路由引擎:按任务复杂度、KV 缓存亲和、实时负载动态选模型,再用 Contextual Bandit 从真实执行反馈里持续修正策略,让下一次判断更准、更省。
正文摘录
openJiuwen X-Router 自演进模型路由技术首发,昇腾亲和,Agent 越跑越省,实测减少 50+% Token 消耗 不是所有任务都需要最强的模型。让每一次请求选对模型,让每一次反馈都成为下一次更优、更省的选择。 它调用的,是一个参数量千亿、跑在云端最贵算力上的模型。你问它一个需要通盘推演、写五十行代码、还要自己 debug 三轮的难题,它调用的还是同一个模型。 问题还不止于“贵”。真实场景里,一个 Agent 往往同时握着本地模型、云端模型,以及来自不同厂商的多种服务。当可选模型越来越多,新的麻烦随之出现: 用户真正需要的,不是一张需要反复维护的模型路由表,而是让 Agent 自己完成判断:这次请求该由谁处理,为什么这样选择,下一次能否做得更好。 点外卖时,平台不会派最近的骑手去送最远的一单,也不会为了三公里的单子调动整个配送站;医院分诊台不会让所有人直接挂专家号,而是先判断病情轻重,再决定看哪个科室、找哪位医生;快递分拣中心如果想要“送得快”,前提是“分得准”。 今天的 Agent 背后,现实已经是一支队伍了:有的模型推理能力强但贵且慢,有的轻快便宜但只能干简单活,有的擅长写代码,有的多模态理解更好。 每个模型各有所长,也各有所短。以 PC 办公场景为例,删除文件和写 PPT,所需的能力显然不同。 openJiuwen 是由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者联合构建的开源 AI Agent 平台。 此次,openJiuwen 团队给出的答案是——在 Agent 与模型之间,增加一层面向请求的智能决策能力,一个专门负责“这一轮任务,该用哪个模型、用什么策略”的路由引擎。 简单的问题,用轻快的模型快速回;复杂的问题,调度更强的模型深思考;需要多个模型互相印证的问题,组织多模型协同作战、再统一汇总;