DuoMem:通过双空间蒸馏实现强大的设备端记忆智能体
基于大语言模型(LLM)的智能体通过多轮交互可解决复杂程序任务,但依赖大模型、长上下文和重复推理,难以部署在资源受限设备上。为此,我们提出 DuoMem,一种双空间蒸馏框架,将程序问题求解能力从大型教师模型迁移至紧凑学生模型。 DuoMem 在两种互补空间进行蒸馏: 1. 上下文空间蒸馏:用教师生成的高质量程序记忆替换学生生成的记忆,并拼接到学生输入; 2. 参数空间蒸馏:在成功教师轨迹上微调轻量级 LoRA 适配器。 在 ALFWorld 基准测试中,DuoMem 将 4B 参数模型的任务成功率从 4.3% 提升至 77.9%,接近 72B 教师模型的 87.1%,而仅增加不到 10M 可训练参数和数兆字节预计算记忆。此外,增强后的 4B 模型推理速度比 72B 教师快 3 倍以上,适用于实时边缘部署。跨 8 个模型(2B72B)的消融实验表明,两个蒸馏维度互补,共同贡献性能提升。
论文精读
TL;DR DuoMem 通过上下文和参数双空间蒸馏,将大模型的程序性记忆能力迁移到小模型,使 4B 模型在 ALFWorld 上成功率从 4.3% 飙升至 77.9%,接近 72B 教师模型,推理加速 3 倍,可端侧部署。
问题
问题背景
LLM 驱动的 Agent 通过多轮环境交互完成复杂程序化任务,但其强依赖 大模型参数量、长上下文窗口和多次推理调用,难以部署在资源受限的端侧设备上。社区正寻求将此类记忆增强型 Agent 的能力蒸馏到紧凑模型中,以兼顾性能与效率。
现有方法局限
- 记忆质量依赖学生模型:现有记忆增强方法通常由学生模型自行生成程序化记忆,受限于小模型对环境探索的不充分,这些记忆往往噪声大、覆盖不全,无法提供高质量的决策引导。
- 蒸馏维度单一:多数工作仅聚焦参数层面的蒸馏(如标准 KD 或全量微调),忽略了上下文空间中教师知识的价值;即使使用上下文学习,也未系统性地将教师生成的高质量记忆直接注入学生输入前缀。
- 部署开销过高:直接蒸馏大模型常引入大量额外可训练参数(如全量适配器)或显著增加推理时上下文长度,与端侧部署的 轻量化、低延迟 需求矛盾。
为什么这个问题难/重要
将教师模型的程序化求解能力转移至小模型面临三重挑战:
- 成功轨迹稀疏:小模型在复杂具身决策任务(如 ALFWorld)中成功率极低(例如 4B 模型仅 4.3%),导致用于监督微调的正面样本匮乏。
- 双维度互补难平衡:上下文空间记忆提供即时指导但受限于固定容量,参数空间微调可内化知识却容易过拟合——需设计联合蒸馏框架使二者协同。
- 实时性要求:端侧部署要求低推理延迟和极小参数增量(本工作中仅增加 <10M 可训练参数、几 MB 预计算记忆),否则即便性能达标也无法实用。 业界对诸如 AR 辅助、家用机器人等需要实时环境交互的嵌入式 AI 系统关注度极高,该问题的解决将直接推动大模型 Agent 的“最后一公里”落地。
行业类比
类似将云端游戏渲染引擎的复杂逻辑蒸馏到移动端芯片上运行的轻量级推理模型,DuoMem 让端侧 Agent 在 ALFWorld 具身决策 中几乎追平 72B 教师,同时推理速度快 3 倍以上。
核心洞察
- 双空间蒸馏的互补性是转移程序性记忆的核心创新。以往工作要么在上下文层面注入知识,要么仅对模型参数做微调,但 DuoMem 首次将两者结合:context-space 蒸馏直接用 teacher 的高质量记忆替换 student 的自产记忆,消除噪声累积;parameter-space 蒸馏通过 LoRA 让学生学会如何利用这些记忆做出正确决策。两个空间分别解决“记住什么”和“如何用记忆”的问题,互补后使得 4B 模型性能从几乎随机提升到接近 72B 模型,且无需额外在线成本。
- 程序性痕迹(trajectories)的蒸馏实现了任务解决能力的无损压缩。与常规知识蒸馏只关注输出分布不同,DuoMem 把 teacher 在多步交互中的成功经验——即完整的动作序列与观察结果——封装为固定记忆库,再通过 LoRA 将这些决策模式蒸馏到 student 的参数中。这种对“过程”而非“答案”的蒸馏,使得小模型能够重现大模型的推理流程,在 ALFWorld 这种需多步规划的任务上,用不到 10M 参数和几 MB 内存就弥补了 80% 的性能差距,且推理速度快 3 倍以上,真正让端侧代理可部署。
方法
DuoMem 采用双空间蒸馏框架,将大型教师模型(如 72B)的程序式问题求解能力迁移至轻量级学生模型(如 4B),使其能在资源受限设备上运行记忆增强型 Agent。
整体流程
- 轨迹采集:教师模型在 ALFWorld 等具身决策环境中与环境多轮交互,收集成功的任务轨迹(observation-action 序列)。
- 上下文空间蒸馏:从教师轨迹中抽取高质量的过程记忆,推理时以前置记忆的形式插入学生模型的输入,替代学生原本可能低质量的记忆生成。这一步骤相当于为学生提供外部的、已完成验证的步进指南。
- 参数空间蒸馏:利用教师成功轨迹作为训练数据,在学生模型上通过 LoRA 进行参数高效微调。微调目标让学生学会如何有效利用前置记忆,在给定上下文下预测正确的行动。
关键模块
- 上下文蒸馏器:负责将教师轨迹整理为结构化记忆(如任务步骤、观察结果和已执行动作),并以固定格式拼接至学生 prompt 头部。
- LoRA 适配器:仅增加不足 10M 可训练参数,通过模仿教师的决策分布进行微调,保持学生模型的主体参数冻结。
输出
在推理阶段,学生模型接收包含教师记忆的增强输入,经 LoRA 适配的前向传播后输出下一动作,直到任务完成。DuoMem 将 4B 模型的任务成功率从 4.3% 提升至 77.9%,接近教师 87.1% 的水平,且推理速度提高 3 倍以上。
与仅依赖参数蒸馏或仅使用外部记忆的方案不同,DuoMem 在上下文空间(注入直接可用的过程知识)和参数空间(调整学生行为以适应记忆)双重互补,使小模型不仅获得了教师的“思考结果”,也习得了如何利用这些结果进行决策,从而在边缘设备上实现高性能、低延迟的 Agent 部署。
实验
实验设计
DuoMem 在 ALFWorld 具身决策基准上验证,该环境要求 agent 通过多轮交互完成复杂过程性任务。实验以 72B 参数 LLM 为 teacher,在成功轨迹上收集高质量过程记忆;student 模型为 4B,但消融实验涵盖 2B–72B 八个规格。蒸馏在两个空间进行:context-space 蒸馏将 teacher 记忆预置于 student 输入,parameter-space 蒸馏在 teacher 成功轨迹上对 student 施加 LoRA 微调(<10M 参数)。评估指标为任务成功率,并分析参数量、上下文开销、步数效率与实际耗时。
关键发现
- 性能飞跃:原始 4B 模型成功率仅 4.3%,DuoMem 将其提升至 77.9%,逼近 72B teacher 的 87.1%,差距缩小至 9.2 个百分点。
- 极致轻量:额外可训练参数不足 10M,预计算的 teacher 记忆仅占数 MB 存储,无需保留大模型权重。
- 推理效率:增强后的 4B 模型 wall-clock 时间比 72B teacher 快 3 倍以上,适合边缘实时部署。
- 双空间互补:消融显示 context 蒸馏与 parameter 蒸馏各自都有显著贡献,但结合效果最优,尤其 context 蒸馏对小模型补救作用明显。
基线对比深度解读
基线 4B 模型几乎不具备具身任务能力,仅凭参数蒸馏(LoRA)或仅凭 context 蒸馏均无法达到 70% 以上,表明过程性推理需要记忆与策略双重迁移。DuoMem 通过 teacher 记忆注入弥补了 student 上下文建模的不足,再配合参数微调顺应 teacher 的控制风格。与直接部署 72B 模型相比,DuoMem 在保持 89.5% 相对成功率的前提下,大幅降低推理成本与延迟,为资源受限环境提供可行路径。与其他仅做记忆检索的工作(如 MemP)相比,DuoMem 的参数蒸馏进一步提升了鲁棒性,证明了双空间设计在实际工程中的优势。
行业影响
落地场景
DuoMem 的核心价值在于让复杂多步推理 agent 能够高效运行在资源受限设备上,直接赋能端侧 AI 代理。典型场景包括:
- 智能家居与机器人:语音助手或服务机器人需要执行多步环境交互任务(如“打扫房间”“准备晚餐材料”),DuoMem 可将大模型能力蒸馏至 4B 模型,在本地 SoC 或嵌入式 NPU 上实时决策。
- 移动 AI 助手:个人设备上的日程管理、行程规划、设备控制等 agent,通过预计算 teacher 记忆和 LoRA 适配器,无需联网即可完成复杂流程,保护隐私。
- 边缘计算 IoT:工业物联网中,现场的传感器融合、异常处理流程需要记忆历史成功轨迹,DuoMem 使轻量模型也能具备持续学习与推理能力。
商业价值
- 推理成本大幅下降:用 4B 模型替代 72B 教师模型,内存占用、算力需求降低一个数量级,使大规模部署成为可能。
- 用户体验提升:任务完成速度提升 3 倍以上,延迟降至实时交互级别,直接改善端侧产品的响应速度和用户满意度。
- 离线可靠性与数据隐私:数据不出设备,无需上传至云端,满足金融、医疗等行业合规要求,同时节省网络带宽成本。
与现有工作流的接口
DuoMem 可无缝集成到现有 LLM agent 栈中:
- Agent 框架:在 LangChain、AutoGen 等框架中,将 DuoMem 的上下文蒸馏模块作为记忆检索层的增强,用预生成的 teacher 记忆替代 student 自己的记忆,输入给轻量模型。
- 模型部署:LoRA 适配器以 PEFT 形式热插拔,与 vLLM、llama.cpp 等推理引擎兼容,仅需几 MB 的额外存储。
- 离线预处理:Teacher 轨迹与记忆在云端/服务器端一次性生成,打包为静态资源分发到边缘设备,无需修改学生模型权重之外的代码。
具体落地用例
- 电商智能客服 bot:运行在客戶终端 App 上的本地客服代理,处理退货、换货等多步流程。DuoMem 让 4B 模型能遵循标准操作流程,理解上下文并执行多轮交互,响应速度达毫秒级,同时保证对话隐私不离开设备。
- 自动驾驶域控制器:在车端芯片上部署的驾驶决策 agent,需基于高精地图和实时传感器输入完成变道、超车等多步决策。通过蒸馏 72B 模型的驾驶轨迹记忆到轻量模型,可在低算力芯片上实现高成功率,且端到端延迟满足安全要求。
局限
- **评估场景单一**:实验仅基于 **ALFWorld** 一个具身决策基准,该环境任务结构相对规律,对多步推理和开放式交互的代表性有限。方法在跨领域任务(如 Web 导航、数据库操作)上的泛化能力未经验证,从单一环境到实际边缘应用的迁移风险较高。
- **依赖高质量教师记忆**:上下文蒸馏需要教师模型为每个任务预先生成高质量记忆,教师轨迹的完整性与准确性直接影响学生表现。在实际动态任务中,教师可能产生次优或错误记忆,累积偏差可能导致下游失效;且离线预计算成本随任务规模线性增长,限制了方案对高频变场景的适用性。
- **检索与融合的静态设计**:记忆检索依赖固定数量(如 top-k)的相似记忆,未考虑任务复杂度的动态调整;基于嵌入相似度的检索对表面形式敏感,长尾分布下可能遗漏关键步骤。此外,预计算记忆被简单前置汇入上下文,缺乏更灵活的记忆交互(如动态更新、冲突消除),在持续学习中可能出现记忆过时。