LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成
视频扩散模型随机性强、难以控制:精确内容常需反复采样且不保证成功,长时程场景在外观、交互与时间连贯性上容易漂移。智能体视觉创作 可提供显式参考、可编辑 3D 场景或可执行游戏状态以实现稳定控制,但本身无法保证物体与角色保真度。二者结合,才能兼顾稳定与高质量生成。 为此,我们提出 LynnReal-Omni,一个原生多模态视频生成框架,构建在 32B 共享多模态扩散 Transformer 之上,统一了文生视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复与长视频生成。它接受外观参考、可编辑 3D 渲染与游戏录制等异构视觉输入,让智能体能在单一模型内组合视觉条件;我们还训练了专用的 27B Flash 共享多模态扩散 Transformer 用于实时渲染。 数据侧,我们搭建了系统化流水线(视频清洗、主体关联、多模态标注与对齐控制构建),产出多镜头音视频精选语料;并提出 MSAVP:包含 100 条 prompt、20 项指标,分别考察指令遵循、生成合理性、视觉质量、时序行为与音频协同。 LynnReal-Omni-Flash 通过模型与解码加速(含轻量 VAE 解码器)进一步降低推理成本:在单张 H100 上,22 帧 540p 视频的预热生成与解码耗时 843 ms,Flash 仅需 377 ms。这为实时流式视频生成奠定基础,也使 LynnReal-Omni 成为智能体视觉创作统一、可控且高效的基础。
论文精读
TL;DR LynnReal-Omni 是 32B 多模态扩散 Transformer,统一文本/图像/参考/结构/编辑/修复/长视频生成,并结合代理式视觉控制,提供 377ms 实时高清生成,为可扩展智能体视觉工作流奠定基础。
问题
问题背景
视频生成领域当前聚焦于提升可控性与长时域一致性,特别是面向代理工作流的视觉内容创建,需要将生成能力嵌入可编辑、可执行的创作管线。
现有方法局限
传统视频扩散模型本质上是随机采样过程,难以精确控制内容:对同一提示词需重复采样且不保证成功,长视频生成中外观、物体交互与时间一致性易发生漂移。代理式视觉创建(agentic visual creation)通过显式参考图、可编辑 3D 场景或可执行游戏状态提供稳定控制,但这类方法自身无法保证生成对象或角色的高保真度,往往需要与生成模型二次集成。两套系统割裂,导致控制条件与生成质量无法在单一模型中协同优化,工作流复杂且推理成本高。
为什么这个问题难/重要
核心挑战在于统一多模态条件表示:外观参考、3D 渲染、游戏录像等异构输入需要映射到共享特征空间,同时保持时空一致性。长视频生成需在有限上下文窗口中平衡历史信息与计算开销,实时渲染则要求模型压缩与解码加速,例如从 32B 主干到 27B Flash 变体及轻量 VAE 的工程实现。业界高度关注统一模型能否同时满足可控性、保真度与低延迟,这直接决定代理式视觉工作流能否从实验走向生产。
行业类比
类似于游戏引擎中实时渲染与物理模拟的结合,代理式视频生成需要将逻辑控制与视觉生成解耦后统一,使可编辑场景直接驱动高质量画面输出。
核心洞察
- 融合 agentic 显式控制与扩散生成:现有视频扩散模型依赖文本或图像条件,缺乏对物体身份、交互关系和长时序一致性的硬约束;而 agentic 视觉流程(如可编辑 3D 场景、游戏状态)虽能提供稳定控制,却难以保证生成对象的高保真度。LynnReal-Omni 将可编辑 3D 渲染、游戏录制、外观参考等异构控制信号直接作为统一模型输入,让扩散过程受结构化场景约束,从而在长视频生成中减轻外观漂移和交互错乱,为可控视频生成提供新范式。
- 共享多模态 transformer 统一异构视频任务:多数现有方案为不同任务维护独立模型或多阶段流水线,导致部署复杂且难以实时响应 agent 请求。LynnReal-Omni 使用单个 32B 共享扩散 transformer 覆盖 text-to-video、image-conditioned、reference-guided、structural control、editing、restoration、long-video 等任务,并额外蒸馏 27B Flash 模型与轻量 VAE decoder,将 22 帧 540p 视频生成加解码压至 377 ms(单 H100),为 agent 工作流中的实时流式视频生成提供统一后端。
方法
输入与任务表示
LynnReal-Omni 接收异构视觉输入,包括外观参考、可编辑 3D 渲染、游戏录制等。框架基于一个 32B 共享多模态扩散 Transformer,将文本到视频、图像条件生成、参考引导、结构控制、编辑、修复、长视频生成统一为不同任务表示,代理人可在同一模型内组合这些条件。
关键模块
- 数据管线与多任务训练:从公开视频清洗、镜头分割、主体发现与关联、多模态标注、对齐控制构建,得到多镜头视听片段用于训练。同时训练一个 27B Flash 变体,通过少步蒸馏加速推理。
- 长视频生成:采用 chunk-wise 生成策略,结合有界历史 与 紧凑时间上下文,在保持时序一致性的同时控制计算量。
- 轻量解码器蒸馏:蒸馏一个轻量 VAE 解码器,减少解码延迟,与 Flash 模型配合实现实时渲染。
- 时序修复:对生成视频中的伪影进行逐帧修复和全序列评估,提升长视频质量。
- 代理场景与游戏控制:从图像分析构建可编辑 3D 场景,优化姿势与相机、修正接触,并生成游戏逻辑时间控制。
输出与效率
输出为高保真、可控的视频流;在 H100 上,标准版生成 22 帧 540p 视频耗时 843 ms,Flash 版仅需 377 ms,支撑实时流式生成。
与同类方法的差异
不同于将代理控制与视频扩散分离的方案,LynnReal-Omni 将异构视觉条件原生集成到统一 Transformer,并专为实时性设计 Flash 变体与轻量解码器,实现代理驱动的视觉工作流。
实验
实验设计
论文构建 MSAVP (MultiShot-AV-Physics Bench),包含 100 个 prompt、20 项指标,分离指令遵循、生成合理性、视觉质量、时间行为、音频协调。评估流程采用五步:冻结评分清单、收集专家证据、运行 prompt-blind 法官、运行主法官、验证聚合。同时在单块 H100 上测试 22 帧 540p 视频的 warm generation + decoding 延迟。
关键发现
LynnReal-Omni 标准版延迟 843 ms,Flash 版 377 ms,降低约 55%,验证了模型与解码加速(包括轻量 VAE decoder)的有效性。MSAVP 框架将物理与视听评估分工为专门证据和双层法官,降低单一模型评估偏差。论文还展示了多模态控制(参考外观、可编辑 3D、游戏状态)在同一骨干内统一的条件组合,避免多模型拼接。
基线对比解读
与常见 video diffusion baseline 相比,该工作强调 native multimodal 共享 transformer,而非外部 ControlNet 或多模型级联。Flash 版通过 27B 共享 transformer + 轻量 VAE,在实时渲染场景中以约 377 ms 延迟逼近流式生成,且不牺牲统一任务接口。这种“一个骨干多任务 + 蒸馏加速”的路线,对工程上减少多模型维护成本、提升部署一致性有参考价值。
行业影响
落地场景
LynnReal-Omni 统一了多模态条件输入与视频生成,适合需可控视觉合成的 agentic workflow。落地场景包括:
- 电商虚拟试穿与商品动态展示
- 广告素材自动化生成
- 游戏原型/宣传片制作
- 企业产品演示与教育动画
Flash 变体实时推理(22帧540p 377ms)支持交互式预览。
商业价值
- 降本:替代部分昂贵3D渲染与实拍,减少后期人工
- 增收:批量个性化视频可提升广告点击与转化
- 体验提升:实时生成加快创意迭代,缩短生产周期
接口集成
模型可通过标准 API(REST/gRPC)或 Hugging Face 部署,输入支持参考图、3D渲染、游戏录制等,便于与现有 agent 框架或视频编辑工具链集成,作为视觉合成模块。
具体 use case
- 电商商品视频:商家上传商品参考图像与可编辑3D场景(如家居布局),生成多角度演示视频,快速适配季节/主题促销。
- 企业产品营销:从 CAD 模型或游戏引擎渲染帧生成操作演示视频,配合音频对齐,用于官网与社媒,显著降低外包成本。
局限
- - 论文未充分讨论统一多模态 backbone 在不同任务间的干扰或负迁移问题。虽然声称支持 text-to-video、image-conditioned、reference-guided、structural control 等七类任务,但实验部分主要展示生成质量与推理延迟,缺乏对单任务 vs 多任务联合训练的性能对比。统一模型往往在个别任务上弱于专用模型,论文未给出相关 ablation 或 trade-off 分析,这限制了从业者评估其实际部署价值。
- - MSAVP 基准仅包含 100 个 prompt 和 20 个指标,样本规模较小,且指标由 LLM judge 生成,可能存在评分偏差和过拟合风险。虽然设计了五步验证流程,但缺少与人工主观评价的大规模相关性验证,也没有在公开基准(如 VBench、EvalCrafter)上的对比结果,难以客观定位其 SOTA 水平。
- - 实时生成性能是以牺牲分辨率和时长为代价的:Flash 模型生成 22 帧 540p 视频耗时 377 ms,但未说明视频时长(约0.9秒)和帧率,且轻量 VAE 解码可能引入空间/时间伪影。对于长视频和高质量需求,仍需要标准模型,难以在边缘设备或高分辨率流式场景中直接使用。