一句一剧:基于多智能体系统的个性化短视频剧情生成
现有短视频制作方法通常依赖一次性 LLM 生成的脚本和松耦合流水线,难以满足三大关键需求:(1) 叙事节奏——导致钩子较弱、升级不足、结尾乏味;(2) 空间一致性——场景布局漂移、角色位置跨片段不一致;(3) 生产级质量控制——需大量人工审查和修正脚本及视觉阶段。 本文提出 One Sentence, One Drama,一种层次化多智能体框架,将用户单句创意通过结构化中间模块和迭代优化转化为完整短剧。核心包含三部分:(1) 多智能体辩论式故事生成模块,强制遵循短剧节奏与叙事连贯性;(2) 3D 接地首帧生成机制,建立共享空间参考确保角色与场景布局跨片段一致;(3) 多阶段评审循环,在脚本、视觉和视频生成阶段进行综合错误检测与定向修正。此外引入场景级 BGM 匹配和场景过渡规划以提升沉浸感。 为系统评估该任务,我们提出 Short-Drama-Bench 基准,在标准视频质量指标上扩展了短剧特有标准。实验表明,本方法在叙事质量、跨片段一致性和整体观看体验上显著优于现有流水线。
论文精读
TL;DR 从一句话到完整短剧,通过多智能体辩论、3D 空间引导与多阶段审校,系统性解决叙事节奏、画面一致性与制作级质控难题。
问题
问题背景
数字短剧生成正成为 AI 视频创作的重要方向,目标是将用户的一句话创意自动转化为具有完整叙事结构和视听效果的短视频。
现有方法局限
当前主流方案依赖单次 LLM 生成剧本与松耦合的模块流水线,缺乏跨阶段的协同优化,导致三大技术缺陷:
- 叙事节奏控制薄弱:LLM 一次性输出的剧本常缺少有效的“钩子—冲突升级—高潮结局”结构,开篇吸引力不足,冲突推进乏力,结局平淡,不符合短剧的紧凑叙事要求。
- 空间一致性缺失:不同镜头之间角色位置、场景布局难以保持统一,呈现画面漂移与角色错位,因为现有方法没有建立共享的空间参考系。
- 制作级质量保障不足:脚本、关键帧、视频生成各阶段均需大量人工审查与修正,无法自动化地检测跨模态错误(如台词与画面不匹配、镜头跳跃)。这源于缺少贯穿全流程的评审与迭代机制。
为什么这个问题难且重要
短剧生成是多模态协同任务,需同时满足叙事逻辑、视觉连续性和节奏控制,对模型的可控性与一致性提出极高要求。叙事节奏要求预定义结构(如脚本分节、高潮布局),空间一致性依赖 3D 先验或显式的场景表示,而制作级质量需要多层级自动化评审。三者叠加使得端到端自动化极具挑战。业界对短剧内容的需求快速增长,高效、高质量的生产工具能显著降低成本,加速创意迭代,因此该方向在学术和产业都受到高度关注。
行业类比
这类似于故事可视化(story visualization)中,从文本生成多帧连贯图像的挑战,但短剧生成进一步要求镜头间的动态叙事张力与时间连续性,如同从“静态漫画”升级到“动态导演”。
核心洞察
- 多智能体辩论机制强制执行短剧叙事节奏:不同于一次性LLM生成脚本,本框架通过多智能体辩论过程打磨故事起承转合,确保吸引人的钩子、层层推进的冲突和有冲击力的结局。这比单一模型生成更符合剧本创作中迭代讨论的本质,解决了现有方法叙事张力不足的痛点。
- 3D-grounded首帧生成建立跨片段空间一致性:通过引入3D先验生成首帧作为共享空间参考,有效避免了现有视频生成管道中常见的场景布局漂移和角色位置不一致问题。与完全依赖2D生成的方法相比,3D grounding提供了持久的世界坐标,使得多片段短剧的视觉连贯性大幅提升。
方法
输入:单句创意
用户提供一句剧情梗概,系统将其转化为完整的短剧。
关键模块
多智能体辩论故事生成
基于检索增强的分级章节规划:从原子剧本语料库中检索相关片段,多个角色化 Agent(如编剧、评论家)通过辩论迭代打磨剧本,强制遵循短剧的叙事节奏(钩子、冲突升级、高潮结尾),确保故事连贯性与吸引力。视觉资产与提示生成
根据剧本生成角色、场景等视觉资产描述,并利用 3D-grounded 首帧生成 机制建立共享的空间参考,通过首帧设定角色位置、镜头布局,保证后续片段的空间一致性。关键帧到视频生成(3D 先验驱动)
以 3D 一致的首帧为约束,驱动视频扩散模型生成各片段视频,维持多镜头间的角色定位和场景连续。多阶段审查与迭代修正
在文本、图像、视频阶段分别引入 reviewer Agents,自动检测叙事漏洞、视觉不一致、画面缺陷等问题,并触发定向修订,实现全流程生产级质量把控。后期制作与组装
自动匹配场景级 BGM,规划多样化的转场效果,最终合成带音频的完整短剧。
输出:带配乐和转场的短视频短剧
与同类方法差异:传统方案依赖单次 LLM 生成脚本及松散管线,缺乏节奏约束与跨片段一致性保障;本文通过多智能体协作、3D 空间锚定和闭环审查,首次实现从单句创意到高质量短剧的全自动化、迭代优化生产。
实验
实验设计
本研究提出 Short-Drama-Bench 评估基准,在标准视频质量指标基础上引入叙事节奏、空间一致性和制作级质量等短剧专属评价维度。实验数据来自自建的脚本语料库与 BGM 库,覆盖多类型短剧场景。评估采用定性分析(人工评分)与定量分析(自动化指标)相结合,并通过消融实验验证各组件的独立贡献。基线方法为基于单次 LLM 脚本生成与松散视觉管线的传统方案。
关键发现
- 叙事质量:多智能体辩论式故事生成有效提升剧情吸引力,开篇钩子、冲突升级与结局反转让整体叙事评分大幅领先基线。
- 空间一致性:3D 先验约束的首帧生成机制使角色位置与场景布局在连续剪辑间保持稳定,人物漂移现象显著减少。
- 制作质量:多阶段审稿循环(文本、图像、视频、音频)自动检测并修正错误,将人工审核成本降至最低;场景级 BGM 匹配与转场规划进一步强化沉浸感。
- 消融实验证实,移除任一核心模块(辩论生成、3D 首帧、审稿循环)均会导致性能下降,其中 3D 先验对跨剪辑一致性贡献最大。
基线对比解读
传统管道采用“一次性脚本生成 + 独立视觉模块拼接”的方式,缺乏结构化中间控制与迭代反馈,导致叙事节奏松散、空间错位、质量波动。本文方法通过层次化多智能体架构将创作过程分解为可迭代细化的离散阶段,每个阶段引入领域专用知识(如短剧节奏理论、3D 空间约束),从根本上解决了传统方案的三大痛点。其核心价值在于将影视工业化流程抽象为可自主执行的 AI 工作流,而非简单的端到端生成。这种工程化思路为复杂内容创作提供了更可靠的品质保障,尤其适用于需要一致性叙事的短剧、广告等视频产品。
行业影响
落地场景
One Sentence, One Drama 可直接嵌入短视频平台、互动叙事应用及自动化广告创意管线。用户仅需输入一句话梗概(如“骑士与恶龙对决”或“办公室反转表白”),系统便输出带完整叙事弧、场景切换及背景音乐的短剧。这为 UGC 内容工具、品牌定制化广告、教育动画生成及虚拟主播剧情生产提供了低门槛自动化方案。在电商领域,品牌可将产品故事转化为系列短剧用于社媒投放;在在线教育中,历史事件或语言情景对话可快速可视化。
商业价值
框架通过 多智能体辩论式故事生成 与 多阶段审核回路 将短剧创作从“编剧-分镜-拍摄-剪辑”的多工种协作压缩为单 prompt 驱动流程,直接削减人力与时间成本。据论文的 Time and Cost Analysis,传统制作 3–5 分钟短剧需数天至数周,该方法将端到端生成控制在分钟级。同时,内嵌的 3D 空间一致性模块 减少跨镜头穿帮导致的返工,BGM 匹配与转场规划 提升观看沉浸感,可延长用户留存与广告完播率,拉动收入增长。
与现有产品/工作流的接口
该框架输出由 分镜关键帧、视频片段、音频轨道及转场元数据 组成,可直接导入 After Effects 等后期工具进行微调或与自动化投放系统对接。具体集成方式:
- API 级调用:将框架封装为生成端点,接收文本 prompt 并返回视频资产,接入 CMS 或短视频平台的自动化内容供给。
- 插件形式:为 Figma、Canva 等设计工具提供“一句话故事板”功能,辅助设计师快速产出视频初稿。
- 审核回路复用:其中的 多阶段审核提示(text/image/video review prompts) 可作为质量门禁嵌入现有视频生产管线,无需推翻现有工具链。
具体落地用例
- 电商产品短剧:某家居品牌输入“一只猫闯进客厅打翻花瓶,引发智能家居连环反应”,系统生成 6 集短剧用于 TikTok 投放,每集结尾自动插入产品特写,替代传统静态展示广告。
- 教育动画生成:语言学习平台用该框架将教科书对话生成为连贯动画短剧,适配不同难度等级,学生可输入自定义剧情分支,系统自动保持角色形象与场景布局一致,避免传统视频素材库的拼接违和感。
局限
- **依赖底层生成模型的性能上限**:该框架的脚本生成、首帧渲染和视频生成均依赖 LLM 与扩散模型等外部能力,若基底模型在多角色动作、复杂场景或长时序一致性上存在缺陷,整体短剧质量仍会受限于此,论文未探讨如何解耦或缓解这种上游依赖。
- **3D 空间先验的泛化性不足**:为每个场景构建共享 3D 参考需要人工标注或预先布局,对于用户随意的一句话创意,可能难以自动推断合理的 3D 场景结构;且 3D 约束仅作用于首帧,后续帧仍可能出现逐渐偏移,无法完全杜绝空间漂移。
- **多智能体辩论与多轮审查的计算开销较高**:引入 debate、revision loops 和 review 模块虽然提升了输出质量,但显著增加了 token 消耗与推理时间,作者未给出与一次性生成或轻量级管线的效率对比,实时或大规模部署条件下的成本可控性存疑。