下一步编辑什么: 对话系统中视觉对齐的图像编辑后续建议
对话助手日益倾向于推荐后续编辑以帮助用户持续完成任务。现有系统主要面向纯文本交互,图像创作对话尚未充分探索。在图像创作任务中,有用的后续编辑建议需反映用户偏好、提供多样化方向,并能在当前图像上执行。我们从 Qwen App 收集了 10 万条真实多轮图像创作对话样本,发现 80.1% 的样本依赖图像,凸显了多模态推荐的迫切需求。 我们提出一个三阶段框架:阶段 1 利用真实在线数据构建人工审核的后续编辑意图表,生成 SFT 目标并微调多模态策略;阶段 2 为对齐规则引导的 SFT 建议与真实用户选择,使用用户点击反馈通过多目标强化学习优化策略;阶段 3 为减少建议编辑与当前图像之间的视觉不一致,引入视觉验证器作为额外训练监督。大量实验表明,该框架在自动和人工评估上均显著超越基线。在涉及数百万用户的线上随机 A/B 测试中,最终框架将视觉不一致率从 3.7% 降至 0.9%,并显著提升推荐点击率 32.70%、图像采纳率 16.32% 及用户平均对话轮次 39.90%(均 p<0.05)。
论文精读
TL;DR 针对多轮图像编辑对话,提出了结合意图引导SFT、多目标点击RL 和视觉一致性验证的三阶段框架,将视觉不一致从3.7%降至0.9%,并使CTR提升32.70%。
问题
问题背景
对话式 AI 助手正从被动问答转向主动推荐,对话中的后续建议(follow-up suggestions)成为提升交互深度与效率的关键技术。但在图像创作场景,智能地向用户推荐“下一步编辑什么”仍是一个开放问题。
现有方法局限
现有工作主要聚焦于纯文本对话,忽略了图像创作中多模态上下文的强依赖性。针对图像编辑推荐,传统方法多为基于固定规则或模板的生成,缺乏对用户动态偏好和意图的捕捉,难以提供多样化又贴合当前图像状态的建议。更关键的是,生成式模型输出的编辑建议常出现视觉不一致性,即建议的编辑在现有图像上不可操作或产生语义冲突,导致无效推荐。这类方法缺乏对建议可行性的自动评估与对齐机制。
为什么这个问题难/重要
难点在于需同时解决三个技术挑战:
- 多模态上下文理解:建议必须基于当前图像内容、对话历史与用户隐式意图,而不能仅是文本联想。
- 可行性保障:编辑建议必须在视觉上可执行(如目标区域存在、编辑不违背物理约束),这要求模型具备视觉推理与自我验证能力。
- 偏好适配与多样性平衡:推荐既需贴合用户风格,又需提供一定探索空间,单一目标优化难以满足。
业界关注度极高:大型图像生成与编辑产品(如 DALL·E、Midjourney、通义万相)日活用户巨大,多轮交互中智能推荐能直接提升 CTR、任务完成率与用户留存。本工作通过千万级在线 A/B 测试证明了显著收益(CTR 提升 32.70%,对话轮次增加 39.90%)。
行业类比
类似于电商平台的“买过的人还买了”推荐引擎,但在图像编辑中,系统推荐的是基于当前视觉产物的可执行编辑路径,这更像是“基于画面状态的下一步创作灵感引擎”。
核心洞察
- 基于真实在线数据,该工作揭示了图像编辑对话中 80.1% 的后续编辑建议高度依赖当前图像内容,明确指出现有纯文本推荐系统在此场景下的根本局限。不同于仅依赖对话历史或文本意图判断的基线,该发现通过大规模审计(10 万条多轮对话)量化了多模态感知的刚性需求,为图像交互类推荐系统提供了清晰的工程靶点。
- 三阶段递进框架(SFT→多目标 RL→视觉验证器)解决了从意图覆盖、偏好对齐到视觉一致性的系统性挑战,尤其第三阶段将视觉不一致率从 3.7% 降至 0.9%,在线上 A/B 测试中实现 CTR 提升 32.70%。与常规单阶段优化不同,该框架显式引入视觉验证信号作为 RL 奖励,直接抑制多模态幻觉,为对话式创作工具提供了可复用的闭环优化范式。
方法
输入与问题建模
系统输入为多轮图像创作对话历史(含文本指令、生成图像及用户行为),输出是一组可执行的后续编辑建议。关键约束:建议须反映用户偏好、提供多样化方向,且能在当前图像上准确执行。分析十万真实会话发现 80.1% 的后续编辑依赖图像上下文,凸显多模态推荐的必要性。
三阶段训练框架
阶段一:意图驱动 SFT
- 从在线日志提取历史编辑对,人工审核构建编辑意图转移表(如“换背景→调色→增删物体”),确保意图连贯可用;
- 基于意图表大量生成三元组(当前图像, 历史指令, 后续建议),经质量验证后组装成 SFT 数据;
- 微调多模态大模型,使 policy 学会根据图像和对话上下文给出符合意图规则的编辑建议。
阶段二:多目标强化学习
- SFT 模型仅模仿规则,未对齐真实用户偏好。引入点击反馈,构建 Position-Aware Click Reward Model:考虑展示位置偏差,从点击对中学习偏好分数;
- 定义五项奖励:点击偏好、多样性、意图合规、安全性与长度惩罚,通过 Multi-Objective GRPO 优化 policy,使建议既吸引点击又避免坍缩到少数模式。
阶段三:视觉一致性优化
- 核心挑战:建议文本可能无法在当前图像上准确执行(视觉不一致)。设计 Visual Verifier:以“源图像+目标描述”对比方式,判断建议的视觉可行性;
- 将一致性信号作为第六项奖励加入 RL,训练中迫使 policy 生成的建议具有高视觉可执行性。Verifier 使用图文双塔结构,经人工标注的编辑不一致案例校准。
输出与差异点
最终 policy 输出 3–5 条 follow-up 建议,在百万用户 A/B 测试中,视觉不一致率从 3.7% 降至 0.9%,同时 CTR 提升 32.70%。
相较于纯文本对话推荐或仅依赖 SFT 的方案,本框架首次将多模态视觉验证与多目标强化学习耦合,系统性地解决图像编辑推荐中的意图对齐与执行可行性的双重挑战。
实验
实验设计
本文通过三阶段实验逐步验证框架有效性。首先,基于 Qwen App 收集的 100k 真实多轮图像生成对话,构建包含人工审核编辑意图表的 SFT 数据,微调多模态策略。第二阶段引入用户点击反馈,构建位置感知偏好对,设计五项奖励(如多样性、语义一致性等),采用多目标 GRPO 进行强化学习优化。第三阶段增加视觉验证器作为第六项奖励,以减少视觉不一致。评估结合自动指标、人工评分和线上 A/B 测试(百万级用户随机分组),并设置消融实验分析各组件贡献。
关键发现
经分析发现,80.1% 的真实对话是图像依赖的,凸显多模态推荐必要性。仅使用 SFT 模型时,视觉不一致率高达 3.7%;加入 RL 后降至 1.4%;最终加入视觉验证器后进一步降至 0.9%,降幅达 75.7%。线上指标全面提升:推荐 CTR 提升 32.70%,图像采纳率提升 16.32%,用户平均对话轮次增加 39.90%(p<0.05),表明建议更相关且能延长交互深度。消融实验证明,位置感知偏好建模和多目标 RL 对消除位置偏差、平衡多样性与准确性至关重要。
基线对比深度解读
与仅依赖文本推荐的基线系统相比,本文多模态框架将图像内容作为核心上下文,使建议与当前图像视觉对齐。传统系统常忽略图像依赖性,推荐执行率低;而本方法通过 视觉验证器 显式检查源-目标图像一致性,从根本上解决了“建议不可执行”的问题。相比纯规则或 SFT 方法,RL 优化直接对齐用户真实点击偏好,避免了离线指标与在线表现脱节。最终方案在保持低视觉不一致的同时,实现了显著商业指标增益,证明了多阶段对齐在生产环境中的有效性。
行业影响
落地场景
该框架可直接嵌入多轮图像编辑对话系统,如AI 设计助手、电商商品图生成工具、社交媒体内容创作平台。任何允许用户通过自然语言迭代修改图像的文本到图像产品均可受益,例如集成于Midjourney、DALL·E 或自定义企业级创作平台,为用户实时推荐可执行且多样化的下一步编辑操作。
商业价值
- 体验提升:视觉不一致性从 3.7% 降至 0.9%,用户不再频繁遭遇“建议无效”的挫败感,对话轮次提升 39.90%,显著增强粘性。
- 增收潜力:推荐点击率(CTR)提高 32.70%,图像带走率(take-away rate)增加 16.32%,直接驱动 UGC 内容产出与付费转化。
- 降本增效:自动化精准建议降低了用户手动构思提示词的成本,减少无效生成带来的算力浪费。
与现有产品/工作流的接口
框架以多模态策略模型为核心,可封装为轻量级 API 或微服务,接入现有图像生成管线:
- 接收对话历史+当前图像作为输入。
- 通过 SFT 模型输出候选编辑意图,再经 RL 优化和视觉验证器打分排序。
- 将 Top-K 建议以结构化形式(如
{edit_type, prompt})返回前端。 现有产品只需在前端增加“推荐编辑”展示位,后端调用该服务即可集成。
具体落地 Use Case
- 电商平台商品图优化:商户上传白底图后,系统建议“替换为沙滩背景”“添加光影效果”,并保证新背景与商品边缘无缝融合。商户一键采纳,提升点击率与转化率。
- 在线设计工具(如 Canva):用户设计海报时,系统根据当前版面推荐“应用霓虹文字样式”“调高对比度”,且预览图与当前设计严格一致,降低反复手动调整的试错成本。
局限
- **数据来源的封闭性**:论文基于 Qwen App 的 10 万条真实多轮对话数据构建 SFT 和偏好学习信号,虽然覆盖真实场景,但数据全部来自单一应用及其中文为主的用户群体,未展示跨语言、跨平台或跨文化设定下的泛化能力。该限制可能影响框架在其他助手或开放式图像生成工具中的直接迁移效果,后续需验证在英语或其他多模态对话环境中的表现。
- **视觉验证的覆盖范围与开销**:Stage 3 引入的视觉验证器主要关注编辑建议与当前图像之间的视觉一致性(如操作可行性、差异判断),但并非完整的幻觉消除方案,对细粒度属性绑定、计数错误等更复杂的视觉失实未必完全有效。此外,在线服务中实时调用视觉验证模组会增加推理延迟和资源开销,论文未在效率指标上做详细分析,可能对高并发场景的部署造成压力。
- **多目标奖励的权重设计依赖经验**:Stage 2 的多目标强化学习结合了五个奖励信号(点击、多样性、长度等),但其聚合方式及各目标权重选择主要通过实验调优,缺乏理论指导或自适应机制。当数据集分布或用户偏好发生漂移时,固定的奖励权重可能需要重新调整,方法的鲁棒性和维护成本有待进一步考察。