AgenticGen: 面向广告的奖励引导智能体视频生成
广告视频生成不只是视频合成任务,更是一个以产品为条件的推理问题,其成功由线上业务指标衡量。近期视频基础模型可从多模态条件生成逼真片段,但它们既未优化「产品如何转化为有效广告」,也未优化「如何依据线上业务反馈改进后续生成」。 为闭合这一循环,我们提出 AgenticGen,一个奖励引导的智能体框架,将广告视频生成拆解为两个可训练的推理阶段——策略选择 与 草稿生成,从而暴露出可被线上业务反馈监督的优化目标。AgenticGen 从累积的线上反馈中学习基于表现的奖励,并引入与人类质量标准对齐的 rubric-based reward 作为补充,共同监督策略优化。 DPO 首先将智能体策略推向线上偏好,GRPO 再通过过程奖励与结果奖励对两个阶段做进一步精炼。离线实验验证了奖励模型与逐级策略优化的有效性;在 TikTok 广告系统中的线上 A/B 实验表明,经 DPO 与 GRPO 训练后,AgenticGen 相比 SFT 基线将 CTR 提升 2.72%,CVR 提升 2.63%,Advv 提升 9.61%。
论文精读
TL;DR AgenticGen 将广告视频生成分解为策略选择与草稿生成两个可训练阶段,用在线业务反馈和人类质量奖励进行 DPO 与 GRPO 优化,在 TikTok 广告系统中显著提升 CTR、CVR 与 Advv。
问题
问题背景
广告视频生成已从单纯真实感合成走向 产品条件化推理:有效广告不仅要画面合理,还要驱动点击、转化与有效观看。现有视频基础模型能基于多模态条件生成高质量片段,但很少显式建模“如何把产品转化为有效广告”这一决策过程。
现有方法局限
主流方案基于 SFT 模仿人类视频,优化视觉质量与语义一致性,并未与业务回报对齐。主要短板:
- 奖励信号缺失:训练目标与 CTR、CVR、Advv 等在线指标无梯度连接。
- 闭环反馈未利用:广告系统积累的投放数据无法反向改进生成策略,pipeline 只依赖静态样本。
- 推理与生成割裂:广告需要先选策略(卖点、场景、节奏)再生成草稿,端到端模型把两阶段压成隐式表征,阶段不可解释也不可分别优化。
为什么难/重要
难点在于在线业务反馈 稀疏、延迟、高方差,难以归因到单条视频的具体设计;策略空间离散且巨大,无法用可微规划求解。同时广告视频直接关联商业收入,A/B 测试中 2–3 个百分点的 CTR/CVR 提升即可带来可观规模收益。若能引入 reward-guided policy optimization,生成系统就能根据投放效果自我改进,而不是每次从零采样。
行业类比
类似 LLM 的 RLHF:把视频生成器当智能体,以业务指标为结果奖励、以策略选择为过程奖励联合优化,与推荐系统在线奖励微调排序策略同构。
核心洞察
- 将广告视频生成拆解为 **策略选择** 与 **草稿生成** 两个可训练阶段,使在线业务指标能够直接作为奖励信号监督生成策略。相比传统视频生成模型只优化像素级真实感,AgenticGen 显式暴露中间决策 token,让 DPO/GRPO 可以根据 CTR/CVR 等业务反馈调整生成分布,将生成问题转化为决策优化问题,打通了从生产到优化的闭环。
- 双奖励设计(**performance-based reward** 与 **rubric-based reward**)同时利用在线反馈的收益信号和人工质量标准,缓解业务指标稀疏、噪声大以及 reward hacking 风险。与仅对最终视频做 RLHF 或 DPO 的方法不同,AgenticGen 将偏好优化作用在策略选择与草稿生成两级,结合 DPO 的离线偏好对齐与 GRPO 的过程/结果奖励细化,实现了更细粒度的信用分配,工程上更适合广告场景的持续迭代。
- 在线 A/B 实验显示 AgenticGen 经过 DPO 与 GRPO 后,相对 SFT baseline 在 CTR、CVR、Advv 分别提升 2.72%、2.63%、9.61%,证明 agentic 策略优化能直接转化为业务收益。这一结果验证了「先 DPO 后 GRPO」的两阶段训练范式在真实在线反馈下的有效性,为生成式 agent 的在线持续优化提供了可复用的工程路径,避免完全在线 RL 的不稳定性。
方法
输入与总体设计
AgenticGen 将广告视频生成视为产品条件下的两级推理问题:输入包括产品信息、多模态条件(图像/文本/用户上下文)以及累积的在线业务反馈。框架把生成过程分解为两个可训练的推理阶段:策略选择 与 草稿生成。
关键模块
- 策略选择阶段:根据产品特征和反馈信号,模型选择广告创意策略(如卖点、叙事角度、视觉风格等),输出结构化策略。
- 草稿生成阶段:在选定策略指导下,视频生成模型产生草稿视频。两个阶段均被显式暴露为优化目标。
- 双重奖励模型:从在线业务反馈中学习性能奖励,同时构建与人类质量标准对齐的rubric 奖励,分别监督业务效果与内容质量。
- 两阶段策略优化:先使用 DPO 让 agentic 策略向在线偏好靠拢;再用 GRPO 对策略选择与草稿生成进行过程奖励和结果奖励的精细化优化。
输出
最终输出是优化后的广告视频生成策略与视频内容,直接对接 TikTok 广告系统,在线指标 CTR/CVR/Advv 验证业务闭环。
与同类视频生成方法仅优化像素级重建或基础视觉质量的差异在于:AgenticGen 将产品到广告的推理链显式可训练化,并以真实在线业务反馈作为监督信号形成闭环。
实验
实验设计
AgenticGen 的实验包含离线验证与在线 A/B 测试两部分。离线实验用于验证 performance-based reward 和 rubric-based reward 两种奖励模型的有效性,以及 DPO 到 GRPO 的逐步策略优化效果。在线实验在 TikTok 广告系统上部署 AgenticGen,与 SFT baseline 进行对比。框架将视频生成分解为 strategy selection 和 draft generation 两个可训练阶段,分别由在线业务反馈和人工质量标准监督。
关键发现
离线结果表明两种奖励模型互补,DPO 先使策略对齐在线偏好,GRPO 再利用过程与结果奖励进一步细化两个阶段。在线 A/B 测试显示,相对 SFT baseline,AgenticGen 的 CTR 提升 2.72%,CVR 提升 2.63%,Advv 提升 9.61%。其中 Advv 提升幅度最大,说明生成广告能更有效提升广告价值,而不仅是点击或转化。
与基线对比
相比仅使用 SFT 的基线,AgenticGen 通过在线业务反馈闭环直接优化商业指标,而非仅关注视觉质量。DPO 与 GRPO 的组合优于单一优化阶段,凸显分阶段监督和过程奖励的价值。与多数视频生成模型不同,AgenticGen 将业务指标纳入训练目标,是针对广告场景的差异化设计。
行业影响
落地场景
AgenticGen 适用于效果广告视频生成,尤其适合需要海量素材快速迭代的行业。
- 电商平台: 根据商品图片、描述和目标人群,自动生成短视频广告,用于信息流投放。例如,某服饰品牌可批量生成不同风格展示视频,通过在线反馈筛选高转化素材。
- 游戏行业: 用户获取(UA)广告中,自动组合游戏玩法片段、角色特写等元素,生成个性化买量视频。
- 内容平台: 为广告主提供自助创意工具,降低视频制作门槛,同时平台通过 reward 优化提升广告库存价值。
商业价值
论文在 TikTok 广告系统 A/B 测试中,CTR 提升 2.72%,CVR 提升 2.63%,Advv 提升 9.61%,直接拉动广告收入。
- 增收: 点击率和转化率提升带来竞价优势,广告主 ROI 提高,平台 eCPM 上升。
- 降本: 替代部分人工创意与视频制作,缩短素材生产周期,支持“千人千面”动态创意。
- 体验提升: 生成内容更贴合用户兴趣,减少无效广告疲劳,改善整体内容生态。
与现有产品/工作流的接口
AgenticGen 可作为创意生成服务 嵌入广告投放系统。
- 输入接口: 接收商品元数据、受众定向、历史投放数据,输出候选视频。
- 在线反馈闭环: 通过埋点采集曝光、点击、转化事件,更新 performance-based reward,持续优化策略。
- 模型集成: 作为上层策略网络,调用底层视频生成模型(如 Sora 类基础模型),通过 API 解耦。
- 训练管线: 遵循 SFT → DPO → GRPO 流程,可与现有 MLOps 工具(如 Kubeflow、MLflow)衔接,支持离线评估与在线灰度。
该框架将生成任务显式建模为可优化的决策过程,区别于传统端到端生成模型,为可控性和业务指标对齐提供了新范式。
局限
- **动作空间与优化衔接未充分定义**:论文将生成分解为策略选择与草稿生成,但未详细说明两阶段的状态/动作空间设计,以及策略选择的离散决策如何与后续视频生成的可微优化衔接。若策略空间粒度过粗或过细,可能导致搜索低效或策略收敛到次优解,且难以扩展到更多品类与创意维度。
- **实验局限于单一平台与短期在线指标**:在线 A/B 仅在 TikTok 广告系统执行,未验证跨平台、跨文化或非广告场景的泛化性;提升的 CTR/CVR/Advv 未给出置信区间或长期留存/用户满意度等深层指标,可能受特定投放时段、受众或季节性影响,无法证明因果稳健性。
- **奖励模型依赖历史反馈与人工规则**:性能奖励需要积累线上反馈,对新广告主或新产品存在冷启动问题;rubric 奖励基于人工质量标注,可能引入主观偏差,且与业务指标不完全对齐。训练 DPO 与 GRPO 需要大量在线交互,计算与部署成本较高,实际迭代效率未讨论。