openJiuwen 协同昇腾打造算力亲和方案,Agent 首 token 时延减半、存储占用降 25%
openJiuwen 打通 Agent 与算力调度,让 KV Cache 随任务流动,首 token 时延减半。
多 Agent 任务会产生大量 KV Cache(推理中间结果缓存),传统引擎不懂任务状态,只能被动淘汰。openJiuwen 让 Agent 把任务状态实时告诉引擎,主动驱逐、卸载、预取缓存,使首 token 时延减半、存储占用降 25%。
正文摘录
.jpg) 给 Agent 一个任务,它会自己规划、调用工具、读文件、反思修正,一干就是几十分钟甚至数小时;任务再复杂些,还需要多个 Agent 分工协作。任务越长、协作的 Agent 越多,推理过程中产生的 KV Cache 就越庞大,推理时延越久。 问题在于,传统推理引擎只看得到请求和缓存,却看不懂 Agent 正在做什么:子任务已经结束,缓存可能还停留在显存里;会话暂时挂起,缓存却继续占着最贵的位置;会话即将恢复,引擎又要等请求到来才开始加载。 这背后的核心断层是: Agent 掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道 。 近期我们了解到,由华为 2012 实验室、华为云、计算、终端等团队联合打造的 openJiuwen 开源智能体平台构建了智能体"算力亲和"能力 —— 一套打通 Agent 框架、推理引擎与底层算力的全链路协同机制,让 Agent 的任务状态转化为算力可理解、可执行的调度信号,使 KV Cache 从被动管理走向主动协同。 一、推理引擎的困境:看得见缓存,看不懂任务 模型推理过程中,会把已经算过的中间结果(Key/Value)缓存下来(即 KV Cache),生成每个新 token 时就不必把全部历史上下文重算一遍。代价是,上下文越长、并发会话越多,KV Cache 占用的显存就越多 —— 而显存,恰恰是 GPU、NPU 这类 AI 加速芯片上最贵的地方。