面向定制化多模态角色扮演 (Customized Multimodal Role-Play)
统一多模态理解与生成模型增强了人机交互的丰富性,但如何同时定制角色的个性、对话风格和视觉身份,并保持跨模态的输出一致性,仍是一个被忽视的问题。为了填补这一空白,我们提出了新任务——定制化多模态角色扮演 (CMRP),并构建了 RoleScape-20 数据集,包含 20 个角色的训练和评估数据,覆盖个性描述、风格线索、视觉/表情提示及图文交互。 基于统一模型,我们设计了 UniCharacter 两阶段训练框架:统一监督微调 (Unified-SFT) 和 角色特定组相对策略优化 (Character-GRPO)。仅需 10 张图像和对应的交互示例,模型即可习得目标角色,并在生成的文本和图像中展现一致的个性、风格和视觉身份,整个过程约耗时 100 GPU 小时。 在 RoleScape-20 上的实验表明,所提方法显著优于基线。消融研究进一步验证了跨模态一致性设计和少样本定制策略的有效性。我们认为,CMRP 与统一建模的结合为下一代富有角色特色、沉浸式的交互智能体奠定了基础。
论文精读
TL;DR 提出定制化多模态角色扮演新任务,基于统一模型和两阶段训练,仅需10张图片即可实现跨文本与图像的角色个性化与一致生成,性能显著优于现有方法。
问题
当前多模态 AI 正从单一模态理解或生成走向统一多模态理解和生成,如何让模型在交互中同时保持角色身份、语言风格与视觉形象的一致性成为研究焦点。
现有方法局限
- 文本角色对话:可定制个性和对话风格,但无法生成视觉内容,角色呈现不完整。
- 图像个性化生成:能复现角色的外观,但缺乏对话能力,无法根据上下文进行多轮交互。
- 简单拼接:将两种单模态模型组合,往往导致跨模态不一致——文本描述的形象与生成图像不匹配,或角色动作与语言风格脱节。 现有工作均无法在统一框架下联合定制角色的语言与视觉表达,更缺乏面向该任务的专用数据集和评估基准。
为什么这个问题难且重要
- 技术挑战:需要将角色身份、语言风格、视觉外观等多种属性耦合在同一参数空间,且在小样本条件下(仅 10 张图像加少量交互样例)实现快速适配。多模态生成还面临跨模态一致性问题,即文本生成的风格必须与图像生成的视觉身份保持同步。
- 应用驱动:沉浸式交互、数字人、虚拟陪伴等场景要求角色不仅“会说”,还要“会看”“会演”,用户对一致性期望极高,这直接推动统一多模态角色定制成为业界关注焦点。
类似视频生成中的角色一致性难题,但其要求更全面:不仅外观一致,还需在对话中维持连贯的人格与语言风格。
核心洞察
- - 首次提出跨模态角色定制任务与数据集。该工作定义了 Customized Multimodal Role-Play (CMRP) 任务,要求模型同时定制角色的个性、对话风格和视觉身份,并保持文本与图像输出跨模态一致。与以往仅关注单模态角色扮演或图像个性化的方法不同,CMRP 将定制化多模态交互首次作为整体目标,并构建了 RoleScape-20 数据集,包含 20 个角色的多模态训练与评测数据,为构建下一代沉浸式交互代理提供了基准。
- - 高效少样本定制训练流程。UniCharacter 通过两阶段训练框架(Unified-SFT + Character-GRPO),仅需 10 张图像和少量交互示例,以约 100 GPU 小时完成角色定制,大幅降低数据与计算门槛。相较于 DreamBooth 等传统图像个性化方法,该方法借助统一多模态基础模型与分组相对策略优化,在保持跨模态一致性的同时实现快速适应,展现出面向实际应用的可行性与扩展潜力。
方法
UniCharacter 方法基于统一多模态理解与生成模型,通过两阶段训练实现定制化多模态角色扮演(CMRP),核心流程按 输入 → 关键模块 → 输出 组织。
输入与任务定义
给定目标角色仅 10 张图像 及对应的文本-交互示例,模型需同时习得角色的人设(persona)、对话风格与视觉身份,并在多轮交互中保持跨模态输出一致性。
第一阶段:统一监督微调(Unified-SFT)
- 在预训练的统一多模态基座(如支持文本、图像联合生成的模型)上进行监督微调。
- 训练数据来自 RoleScape-20 数据集,每个角色包含:
- 人设与风格描述文本;
- 视觉线索(如表情、姿态、外观特征)的标注;
- 文本-图像配对交互示例。
- 微调目标让模型建立 角色概念 与多模态生成之间的映射,初步具备角色遵循能力。
第二阶段:角色特化组相对策略优化(Character-GRPO)
- 针对每个角色单独部署组相对策略优化(GRPO),以强化学习方式进一步对齐输出。
- 引入 跨模态一致性奖励:对同一对话上下文中,模型生成的文本(语气、用词)与图像(外貌、表情)是否共同忠实地表现角色进行自动评分(如通过视觉-语言一致性模型)。
- 采用 组内对比 机制:采样多个候选输出,根据奖励进行相对排序,更新策略,从而放大符合角色的一致性行为。
- 训练耗时约 100 GPU 小时,轻量级定制。
输出
最终模型在对话中同时生成文本回复与角色图像,实现人设、风格、视觉身份的统一连贯表达。
与现有方案的根本差异:以往方法仅能分别定制角色的对话风格(纯文本)或外观(纯图像),UniCharacter 首次在统一框架内实现 文本-视觉联合角色定制与跨模态一致性生成,使虚拟角色真正具备沉浸式交互潜力。
实验
实验设计
为评估定制多模态角色扮演(CMRP)能力,论文构建了 RoleScape-20 数据集,包含 20 个角色的个性化描述、对话风格、视觉形象及文本-图像交互数据。方法采用两阶段训练:
- Unified-SFT:在通用多模态数据上微调统一模型,建立基础的跨模态理解与生成能力。
- Character-GRPO:针对每个目标角色,仅使用 10 张角色图像和少量交互示例,通过群组相对策略优化使模型快速适配角色人格、语言风格和外观一致性。
评估指标涵盖生成文本的角色忠实度、风格匹配度,以及生成图像的视觉身份一致性与表达准确性。对比基线包括单一模态的角色扮演模型(如 ChatGLM role-play)和图像个性化方法(如 DreamBooth),以验证多模态联合定制的效果。
关键发现
- 跨模态一致性:UniCharacter 在仅 10-shot 设定下,生成的对话和图像均能保持高度一致的角色人格、说话风格和视觉特征,大幅超越仅处理单模态的基线方法。
- 训练效率:整个定制流程只需约 100 GPU 小时,实用性强。
- 消融实验:去除 Unified-SFT 或 Character-GRPO 任一阶段均导致性能显著下降,验证了通用预训练与角色特定优化的协同作用;跨模态一致性设计被证明是避免模态间漂移的关键。
与基线对比的深度解读
先前方法只能独立定制角色的“说”或“看”,无法兼顾。UniCharacter 首次在统一模型内实现双重定制,且不需要大量配对数据。相比纯文本角色扮演,它能产出符合角色视觉形象的图像;相比图像个性化,它能进行上下文感知的对话。Character-GRPO 相较于标准 RLHF 更节省角色适配计算,并利用相对优势排序提升生成质量。这一框架为下一代沉浸式交互代理提供了高效、低成本的定制范式。
行业影响
落地场景
- 虚拟主播与数字人:在直播、短视频等场景中,同时生成符合人设的对话和视觉内容,保持形象一致。
- 互动娱乐:游戏 NPC、虚拟偶像等,提供统一的个性、对话风格与外显形象。
- 教育:定制虚拟教师,讲解时同步生成配图或演示画面,适配不同学科风格。
- 社交与陪伴:个性化聊天机器人,支持在对话中生成表情、贴图等多模态回应。
商业价值
- 降本:仅需约 10 张图片及少量对话示例,约 100 GPU 小时即可完成一个角色的定制,大幅降低多模态角色开发门槛和算力开销。
- 增收:更生动的虚拟角色可提升用户参与度、付费意愿,例如直播间的虚拟礼物收入、订阅制会员等。
- 体验升级:跨模态一致性消除文本与视觉“人格分裂”感,带来更沉浸、可信的人机交互体验。
与现有产品/工作流的接口
- 可集成至现有统一多模态大模型(如 Qwen-VL、Janus)之上,通过 Unified-SFT 与 Character-GRPO 两阶段微调,将通用模型转化为角色专属模型。
- 提供标准化 API:输入参考图片与对话示例,输出可直接部署的推理端点,快速嵌入内容生产管线。
- 作为 AIGC 角色创作工具,与已有素材库、对话脚本工作流对接,减少美术、策划与技术的多轮协调。
具体落地场景案例
- 电商直播虚拟主播:品牌上传产品图与主播对话范例,快速生成代言虚拟人,直播中根据观众提问生成回复并自动展示商品图,保持品牌调性统一。
- 在线教育虚拟教师:教育平台为不同课程定制教师形象与风格,如科学课教师讲解时自动生成实验示意图,文学课教师输出诗词解析并配以古风插图,提升沉浸式学习体验。
局限
- **数据集规模与泛化性受限**:RoleScape-20 仅包含 20 个角色,虽然涵盖了多样的人格、风格和视觉标识,但总体规模较小,难以充分覆盖现实世界中角色的多样性;在长上下文对话、复杂场景下的跨模态一致性也未得到系统验证,泛化到更大规模或更开放场景的能力尚不明确。
- **定制成本与数据门槛较高**:每个角色定制约需 100 GPU 小时,且需提供 10 张参考图像及对应的文本交互示例,这种资源需求对于快速、低成本的个性化部署仍构成障碍;对普通用户而言,收集符合要求的 few-shot 示例并非易事,影响了方法的易用性。
- **方法依赖基座模型且优化复杂度上升**:UniCharacter 的性能高度依赖于统一多模态基座模型的能力,若基座模型存在偏见或生成质量瓶颈,角色定制效果也会受限;Character-GRPO 引入了分组相对策略优化,虽然提升了角色一致性,但增加了训练阶段,且对示例质量和数量敏感,few-shot 条件下的稳定性有待进一步检验。