MemSlides:一种层次化记忆驱动的智能体框架,用于带多轮局部修订的个性化幻灯片生成
个性化演示文稿生成不仅需要基于当前提示或模板进行条件处理,智能体还必须跨任务保持稳定的用户偏好,在多轮修订中保留新引入的偏好和约束,并可靠地执行局部编辑。我们提出 MemSlides,一种用于个性化演示智能体的层次化记忆框架,将长期记忆与工作记忆分离,并进一步将长期记忆划分为用户画像记忆和工具记忆。 - 用户画像记忆存储意图条件化画像,用于第0轮个性化; - 工作记忆在修订轮次中承载活动偏好和会话约束; - 工具记忆存储可复用的执行经验,以实现可靠的局部编辑。 MemSlides 将这种记忆设计与范围限定的幻灯片局部修订相结合,使目标更新作用于最小受影响区域,而非反复重新生成整个演示文稿。在控制实验中,用户画像记忆在多人物、多意图画像库上提升了人物一致性判断;工具记忆注入在诊断性配对设置中改善了闭环修改行为;定性案例展示了工作记忆传递偏好的能力。 综上,这些结果表明,演示文稿创作中的有效个性化依赖于跨生成与局部修订阶段,分离持久用户画像、会话级工作记忆和可复用执行经验。
论文精读
TL;DR MemSlides 通过分层记忆(长期用户画像、工作记忆、工具记忆)与局部作用域修订,实现多轮交互下稳定的个性化幻灯片生成与可靠编辑。
问题
领域背景
个性化演示文稿生成正从“单次提示→完整输出”转向多轮交互式协同创作。业界关注的核心是:AI agent 如何在持续对话中理解并维持用户的长短期意图,同时高效执行精确的局部编辑。
现有方法局限
当前方法普遍存在三类缺陷:
- 记忆机制扁平:仅将用户偏好硬编码进单一 prompt,无法区分持久型用户画像(如配色偏好、风格倾向)与临时约束(如“本次用公司模板”),导致跨任务一致性和会话灵活性失衡;
- 长程依赖断裂:多轮修改时,基于无状态 API 的 agent 缺乏工作记忆,无法自动继承前轮引入的约束(例如“尽量用图表而非文字”),需要用户反复重复要求;
- 编辑粒度粗糙:大多数系统采用“全量重新生成”策略处理修订请求,缺少工具记忆来积累可靠的执行经验(如“如何只替换第三页图表而非整个 slide deck”),既浪费计算资源又易引入意外变更。
难点与技术挑战
- 层次化记忆设计:需要解耦长期身份特征、会话级上下文和可复用编辑技能,并在推理时动态协调三者,避免记忆冲突或遗忘。
- 局部编辑可靠性:将用户模糊的修改意图(如“把第二页字体调大一些”)精准映射到最小受影响区域,并在不破坏非修改部分的前提下完成编辑,对 agent 的规划与执行能力要求极高。
- 实用价值显著:在企业办公自动化、教育课件定制、商业提案快速迭代等场景中,若 agent 能像人类助手一样记住习惯并只修改指定部分,将极大降低沟通成本,因此业界对具备稳定记忆的 agent 框架关注度持续上升。
行业类比
这类似于智能代码助手(如 Copilot)在多轮对话中自动记住开发者个人的命名风格、库偏好,并在后续编辑中仅重构相关函数而非整个文件;MemSlides 将这种 “长期画像 + 工作记忆 + 执行经验” 的层次化记忆范式迁移至演示文稿生成领域。
核心洞察
- MemSlides 提出分层记忆架构,将长期记忆拆分为用户画像记忆与工具记忆,前者存储意图感知的稳定偏好,后者积累可复用的局部编辑经验,配合工作记忆追踪多轮会话中的动态约束,从而在个性化演示生成中保持跨任务一致性。与仅依赖当前提示或简单记忆池的代理不同,这种精细化的记忆分离避免了跨轮的偏好遗忘与约束断裂,使智能体既能全局遵循用户画像,又能灵活响应新出现的修改需求。
- 幻灯片局部修订策略与工具记忆协同:MemSlides 将修改作用域限定在最小受影响的幻灯片区域,而非全量重生成,结合从历史执行中提取的工具记忆,显著提升局部编辑的可靠性与闭环行为。对比现有方法大多进行整份演示文稿的重新生成或简单改写,该设计让智能体能够精准、高效地实施局部更新,同时通过积累经验不断优化编辑质量,为交互式内容创作提供了更符合实际工作流的工程路径。
方法
输入与任务定义
MemSlides 接收用户自然语言指令、当前幻灯片状态以及可选的外部模板,任务是在多轮交互中生成并逐步修订个性化演示文稿。每一轮输入包含用户新提出的约束、修改要求或偏好反馈,系统需结合历史上下文输出局部更新的幻灯片内容。
三层记忆核心模块
框架的核心是将记忆显式划分为长期记忆与工作记忆,长期记忆再细分为用户画像记忆与工具记忆,形成三层体系:
- 用户画像记忆:存储跨任务的稳定个人风格档案。在首轮生成(round-0)时,根据用户当前意图(如“学术演讲”或“产品发布”)检索匹配的画像,将风格偏好(颜色、字体、图表习惯)注入到幻灯片初稿中,实现无监督个性化。
- 工作记忆:维护当前会话中的动态状态,包括用户新提出的偏好(如“将标题改为左对齐”)、正在执行的局部修改范围以及已确认的变更记录。它作为会话级缓存,使得后续修订轮次无需重复声明已采纳的偏好。
- 工具记忆:保存过去执行成功的可重用编辑操作(例如“如何将图片替换为指定URL”、“如何调整表格列宽”),由工具调用历史抽象为经验键值对。当新指令涉及类似元素时,检索相关经验指导工具执行,提升局部修改的可靠性。
局部修订执行流程
每轮修订时,系统解析用户指令并定位受影响的最小幻灯片单元(单页、单个元素或元素组)。通过作用域限制(scoped slide-local revision),仅针对该区域生成变更方案,避免全 deck 重新生成。工作记忆更新积累的上下文,长期记忆中的工具经验辅助该局部编辑的准确执行。
输出形式
每一轮输出均为局部更新后的幻灯片描述(如JSON结构),包含变动元素的位置与新属性,且保留未改动部分。最终用户得到的是贯穿多轮修订后一致且符合个人偏好的完整幻灯片集。
与同类方法的差异
不同于仅依赖单轮提示完成个性化或强行全局重生成的方案,MemSlides 首次在幻灯片生成中通过持久画像、会话约束、可复用编辑经验的三层解耦记忆实现了稳定的跨轮偏好继承与可靠的局部改动,而无需保留完整对话历史或依赖微调模型记忆个体。
实验
实验设计
MemSlides 的评估围绕个性化生成与局部修订两个核心能力展开,采用受控消融实验:
- 个性化评估:构建包含多persona(角色)、多intent(意图)的 profile bank,每个 profile 定义稳定的创作偏好。通过盲审判分方式衡量用户画像记忆对 persona-alignment 的提升,并与无记忆或扁平记忆基线比较。
- 局部修订评估:设计诊断性 matched-pair 设置,成对对比有/无工具记忆注入时,模型在闭环修改指令下的执行表现,聚焦封闭环修改行为(closed-loop modify behavior)的可靠性。
- 工作记忆定性观察:在多轮对话中追踪工作记忆对用户临时约束和偏好的跨回合携带能力,通过具体案例验证。
关键发现
- 用户画像记忆显著改善首轮个性化:注入 profile memory 使生成结果与目标 persona 的对齐度评分明细优于仅依赖当前提示的基线,证明意图条件化的长期记忆能稳定还原用户偏好。
- 工具记忆提升局部编辑的鲁棒性:在 matched-pair 对比中,携带工具记忆的 agent 更准确地执行范围限定的局部修改,避免盲目重生成整个幻灯片,修改成功率与准确性明显提高。
- 工作记忆实现跨回合偏好连贯:定性案例显示,即便用户在多轮中逐步追加新要求,工作记忆能将活跃约束与偏好保留,避免信息丢失导致的重复交互。
与基线对比的深度解读
传统 slide agent 常将个性化简化为单轮提示工程,或用扁平记忆堆砌所有上下文,导致信息混淆、更新迟缓。MemSlides 的分层记忆设计将稳定性(user profile)、时效性(working memory)和可复用经验(tool memory)解耦:
- 对比仅提示的基线,用户画像记忆让 agent 在未见过任务时也能输出符合用户长期习惯的幻灯片,本质上是一种零样本个性化。
- 对比无工具记忆的修订系统,工具记忆把“如何成功修改”的元经验沉淀为可检索资产,使局部修订不再是脆弱的一次性尝试,而是可累积、可改进的闭环过程。
- 工作记忆的存在则弥补了会话内动态偏好遗忘的缺陷,形成完整的长期-会话-执行三层记忆协同,为个性化演示代理的工程落地提供了可复制的架构范式。
行业影响
落地场景
MemSlides 的分层记忆与局部修订能力可直接嵌入企业级办公套件(如 Google Slides、PowerPoint 的 AI 助手),或作为内容中台的核心生成引擎,服务于营销、教育、金融等行业中高频次、强个性化幻灯片制作需求。典型场景包括:
- 企业销售赋能:根据客户画像自动生成量身定制的提案套件,多轮讨论后仅需调整关键页面而非重做整套 deck。
- 在线教育课件制作:为教师生成匹配课程进度的幻灯片,保留教师编辑风格与章节约束,后续课程只需局部更新即可复用。
- 金融投顾报告:生成包含多资产类别、客户偏好的投资组合回顾,响应监管微调时只修改相关区域,避免全量重生成带来的合规风险。
商业价值
- 降本:将人均幻灯片制作时间减少 40%–60%,尤其对需要多客户定制的团队,省去重复性的模板调整与全局修改。
- 增收:通过记忆驱动的个性化体验提升用户粘性与付费转化率——平台可提供“VIP 用户画像学习”等高阶功能,形成差异化 SaaS 收入。
- 体验提升:工作记忆确保多轮修订中用户偏好不丢失,减少了“刚改完一句话,全篇布局又变了”的挫败感;工具记忆使得同类编辑任务(如统一字体颜色)仅需一次修复即可长期生效。
与现有产品/工作流接口
MemSlides 可作为 LLM Agent 插件 与现有幻灯片生态集成:
- 通过 REST API 注入用户画像(结构化偏好标签)和会话上下文,客户端仅需将用户修订意图与当前幻灯片 JSON 描述传给服务端。
- 记忆存储可采用 向量数据库(如 Chroma、Pinecone)持久化用户画像与工具经验,与现有用户数据平台(CDP)打通。
- 局部修订引擎输出 修补指令(如 “替换第3页第2段文本”),可直接对接幻灯片软件的 API(如 Google Slides API、Office.js),无需破坏原有格式与动画。
- 与现有模板生成系统互补:MemSlides 不替代模板选择器,而是增强模板填充与微调的智能化程度。
具体落地案例
- 跨国企业销售自动化:某 SaaS 公司使用 MemSlides 集成其 CRM 系统,根据客户行业、规模、历史沟通记录自动生成首版 pitch deck。销售代表在谈判过程中提出“突出 ROI 数据”或“弱化技术细节”等修改,系统仅重排相关页面,同时工作记忆记住此客户偏好,下次生成自动对齐。记忆库沉淀数百次修订经验后,一次点击即可适配同类客户。
- 内容平台规模化素材制作:某视频内容平台为创作者提供“智能封面与梗概生成”,引入 MemSlides 后,创作者可上传风格样本建立画像,系统生成多版本宣传幻灯片;当创作者对某一页布局提出修改,工具记忆捕获操作模式,未来所有任务中类似布局自动修正,整体生产效率提升 3 倍以上。
局限
- **配置文件记忆** 需要预先标注的意图类别和充足的种子数据来构建用户 profile,在冷启动场景下难以捕获细粒度、动态变化的个人偏好;论文尚未讨论长期记忆的在线更新与遗忘机制,面对用户兴趣漂移时 profile 可能逐渐失效,且 profile 与工具记忆的隔离缺乏自适应调整策略。
- 实验采用**受控的多角色、多意图 profile 库**进行配对比较,并配合人工模板生成评估指令。这一设计侧重内部效度,但在真实的多轮、开放式对话中,用户指令往往夹杂模糊约束、反悔需求和非文本模态,现有评估无法反映此类复杂情况下的记忆保真度和修订稳健性。
- **局部修订** 的作用域建立在幻灯片结构已知且可解析的前提下,但不同模板工具(如 PowerPoint vs. Keynote)的底层对象模型差异显著,工具记忆的跨模板复用困难;当修订需同时调整标题、图表和备注等多处关联元素时,最小作用域策略可能导致上下文断裂,迫使额外回退到全幻灯片重生成。