论文

GRNEdit: 从生成式精炼网络中新二元证据视角的高效通用视频编辑

GRNEdit: 从生成式精炼网络中新二元证据视角的高效通用视频编辑

基于指令的通用视频编辑旨在通过单一直观界面统一多种编辑操作。现有方法通常依赖资源密集型的条件注入,要么使用重型分支,要么使用昂贵的源拼接。是否存在一种高效的方式来建模编辑意图?为此,我们提出 GRNEdit,一个轻量级两阶段框架。GRN 启发我们通过比特组合来编码视觉语义。通过任务特定微调,我们进一步将此表示转化为对单个比特的局部保留或翻转决策。源信息因此被建模为坐标式证据,以支持观察到的二元状态,而 GRN 主干则负责将其全局组合解析为连贯的生成语义。 在第一阶段,一个紧凑编码器将离散源代码转换为连续证据信号,GRN 在二元精炼过程中吸收这些信号。受无分类器引导的空提示训练启发,我们赋予空条件一个编辑特定含义:空指令表示不编辑,并通过源重建进行监督。这一恒等路径不仅隐式增强了第一阶段的证据利用和内容保留,还在与编辑状态相同的表示空间中产生源保留状态。因此,第二阶段可直接比较每个编辑状态与其源保留对应状态,并利用它们的差异来修订未解决的目标比特决策。 仅使用 0.6M 训练对和不到 3% 的条件参数,GRNEdit-2B 和 GRNEdit-8B 在 OpenVE-Bench 上分别取得 4.03 和 4.18 分。2B 模型优于多个 14B 开源编辑器,而 8B 模型与领先的开源编辑器表现相当。

论文精读

TL;DR GRNEdit 把视频编辑意图编码为二进制位保留 / 翻转决策,用源证据轻量驱动生成精炼网络,仅 0.6M 训练对和 <3% 条件参数,2B 模型即超越多个 14B 编辑器,8B 与领先开源持平。

问题

问题背景

指令式通用视频编辑希望把物体替换、风格迁移、属性修改等操作统一到单一文本接口,降低专业工具使用门槛。近期模型生成质量稳步提升,但编辑效率 与 源信息利用 仍是工程落地的关键瓶颈。

现有方法局限

  • 条件注入成本高:主流方案使用重型交叉注意力分支,或将源视频逐帧拼接到噪声输入,导致序列长度和显存占用显著增加,编辑延迟高。
  • 源建模冗余:源视频往往以像素级特征重复注入每一层,缺乏紧凑的语义压缩,参数效率低。
  • 训练代价大:部分方法依赖大规模成对视频-指令数据,或需要多阶段蒸馏,训练开销不可忽视。
  • 可解释性与可控性弱:模型很少显式建模哪些区域或哪些语义位应保留、哪些应翻转,导致编辑结果与源内容不一致。

为什么这个问题难/重要

视频编辑同时要求时序一致性、内容保真、指令遵循,并且要在低参数和低延迟下实现,需求之间存在天然冲突。业界对轻量化、接近实时的通用编辑能力持续上升,尤其是端侧与云端成本敏感场景。GRNEdit 用二进制细化网络(GRN) 将编辑意图表示为“局部保留或翻转”的位决策,并通过坐标级证据 注入源信息,把效率问题转化为表示学习问题:如何从离散源码提炼连续信号,同时保持全局组合一致性。其身份对齐空条件 让空指令等价于源重建,使 Stage II 能直接比较编辑态与源保持态差异,修正未决位决策。该方法以不到 3% 条件参数、0.6M 训练对达到接近领先开源编辑器的分数,说明二进制证据视角具备实际价值。

行业类比

类似短视频应用中实时风格化滤镜:不是每次运行完整生成模型,而是预计算紧凑风格证据,推理时通过少量位调整快速切换效果,显著降低计算成本。

核心洞察

  • 将编辑意图离散化为比特级保留/翻转决策,并以逐坐标证据编码源信息,实现了极轻量条件化。相比主流方法使用重型分支或源拼接作为条件,GRNEdit 仅利用 GRN 自身的二值细化过程,通过小型编码器将离散源码转为连续证据信号,条件参数占比低于 3%。在 0.6M 训练对下,2B 模型超越多个 14B 开源编辑器,证明二值表示在视频编辑中的高效性,为资源受限场景提供了可行路径。
  • 身份对齐的空条件训练创造源保持状态,使第二阶段能通过差异比较进行自参考修正。受 classifier-free guidance 的 null-prompt 训练启发,将空指令定义为“无编辑”并用源重建监督,不仅隐式增强证据利用与内容保留,还生成与编辑状态同表示空间的 counterpart。Stage II 直接计算编辑状态与源保持状态的差异来修正未解决的比特决策,避免额外对齐网络或复杂约束,是一种简洁且可扩展的两阶段推理策略。

方法

输入与整体架构

GRNEdit 采用两阶段流程,输入为源视频、编辑指令(可为空)及二进制源编码。核心来自 GRN 的位级视觉语义表示:编辑意图被转化为对各个二进制位的“保留/翻转”局部决策。

Stage I:源证据注入与身份对齐

紧凑编码器将离散源代码转换为坐标级连续证据信号,逐层注入 GRN 主干,在二进制细化过程中指导全局合成。为强化证据利用,模型借鉴 classifier-free guidance 的 null-prompt 训练:空指令表示“无编辑”,通过源重建监督。该身份路径 同时生成与编辑状态同空间的源保留状态,供 Stage II 参照。

Stage II:身份参照的位边界修订

Stage II 直接逐位比较编辑状态与源保留状态,利用差异修订未确定的目标位决策,无需重新条件化。

训练仅用 0.6M 视频-指令对,条件参数占比 <3%。GRNEdit-2B / 8B 在 OpenVE-Bench 上分别达 4.03 / 4.18,2B 超过多个 14B 开源编辑器。

与依赖重分支或源拼接的方法不同,GRNEdit 将源条件压缩为轻量证据信号,并通过身份对齐的空条件建立自参照,大幅降低条件开销。

实验

实验设计

GRNEdit 在两阶段框架下训练于 0.6M 个视频-指令对,条件参数占比 < 3%。评估采用 OpenVE-Bench 基准,分别对 GRNEdit-2B 与 GRNEdit-8B 两个版本进行测试。

关键发现

  • GRNEdit-2B 获得 OpenVE-Bench 分数 4.03,GRNEdit-8B 获得 4.18。
  • 2B 模型已超过多个 14B 开源编辑器;8B 模型与领先开源编辑器表现相当。
  • 极低的条件参数开销说明二进制证据表示与身份对齐空条件设计能有效建模编辑意图。

与基线对比解读

现有视频编辑方法通常引入重型分支或源帧拼接,带来高额计算与参数成本。GRNEdit 以仅 3% 的条件参数实现有竞争力的分数,其中 2B 模型以小模型规模反超部分 14B 基线,证明二元证据提炼可大幅压缩编辑语义的学习成本;8B 模型与领先编辑器相当,但未指明具体基线,后续可进一步对比分析。

行业影响

落地场景

  • 短视频/广告制作:自然语言指令完成换背景、改风格、物体增删,降低专业剪辑门槛。
  • 电商商品视频:批量生成多场景展示素材,支撑广告投放与 A/B 测试。
  • 社交媒体创作工具:集成指令式编辑到 Web/移动端,提升普通用户创作效率。

商业价值

  • 降本:条件参数占比 <3%,2B/8B 模型量级远低于常见 14B 开源编辑器,推理成本显著降低。
  • 增效:仅 0.6M 训练对即达到与领先开源编辑器相当的性能,训练数据采集成本低、迭代快。
  • 体验提升:身份对齐 null condition 强化源内容保留,减少编辑后画面失真,提高用户粘性。

与现有产品及工作流集成

  • 作为条件适配层嵌入主流视频生成架构(DiT、UNet 或 GRN 骨干),替换重型源条件分支(如 concatenation)。
  • 轻量 encoder 与 evidence injection 模块支持微调适配,可与 LoRA 等 PEFT 方法协同。
  • 封装为 API 或本地插件,无缝接入云视频处理平台或桌面创作软件。

具体 use case:

  1. 电商商品视频:上传产品视频后输入“把背景换成海滩,添加日落光效”,GRNEdit-2B 单卡实时推理,直接产出投放素材。
  2. 在线教育:教师对课程视频说“删除白板笔误,添加字幕高亮”,系统自动编辑,缩短后期周期。

局限

  • **连续编辑表征受限**:GRNEdit 将编辑语义建模为逐位保留或翻转决策,本质上是离散的。但视频编辑中大量操作具有连续强度,如亮度调节、运动幅度变化等,离散二进制表示可能无法精确刻画细粒度编辑意图,导致编辑结果不够平滑或产生伪影。尽管 Stage II 通过位边际修订进行补偿,根本上仍受限于离散空间,与基于连续隐空间的条件方法相比,在精细连续编辑任务上可能存在差距。
  • **评估基准单一**:实验仅在 OpenVE-Bench 一个基准上报告结果,虽然该基准覆盖较广,但单一基准的分数难以全面反映模型泛化能力。文中未展示在 TGVE、Loveu 等其他视频编辑基准或长视频、复杂时序编辑场景下的表现。仅用 0.6M 训练对达到高分数,存在过拟合特定编辑风格或基准偏差的风险,需要更多分布外测试来验证鲁棒性。
  • **两阶段推理增加延迟**:与单阶段编辑模型相比,GRNEdit 需要先通过 Stage I 同时生成编辑状态和源保持状态,再在 Stage II 进行逐位比较与修订,推理流程更长。虽然参数效率突出,但在需要实时交互的视频编辑工具中,额外的计算步骤可能抵消部分效率优势,限制了其在低延迟场景下的部署。
论文Feng Xie2026-08-17原文

相关内容