原生主动感知作为全模态理解的推理
针对长视频理解,被动模型通常采用“全部观看”范式,无论查询难度如何都统一处理帧,导致计算成本随视频时长增长。尽管出现了交互式框架,但它们往往依赖于全局预扫描,上下文成本仍然随视频长度扩展。 本文提出OmniAgent,首个原生全模态智能体,将视频理解建模为基于POMDP的迭代观察-思考-行动循环。OmniAgent执行按需行动,有选择地将音视频线索提取到持久文本记忆中,有效将推理复杂度与原始视频时长解耦。为实现这一目标,我们引入:(1) 智能体监督微调,通过最佳-N轨迹合成与双阶段质量控制引导原生主动感知;(2) 智能体强化学习与TAURA(回合感知自适应不确定性重缩放优势),利用回合级熵将信用分配引导至关键发现回合。 关键地,OmniAgent表现出正向测试时扩展:随着推理回合数增加,性能提升,验证了主动感知的有效性。在十个基准(如VideoMME、LVBench)上的实验结果表明,OmniAgent在开源模型中达到最先进性能。尤其在LVBench上,我们的7B智能体超越了10倍大的Qwen2.5-VL-72B(50.5% vs. 47.3%)。
论文精读
TL;DR OmniAgent 将长视频理解建模为主动感知的推理循环,按需抽取音视频线索解耦时长依赖,7B 模型即超越 72B 大模型。
问题
问题背景
长视频理解是视觉语言模型走向实用化的关键瓶颈。随着视频智能监控、教育内容分析等场景普及,模型需处理分钟级甚至小时级的连续视听信号,而现有方案在效率上捉襟见肘。
现有方法局限
- 被动“全看完”范式:多数模型(如 VideoLLaMA、VideoChat)采用均匀帧采样,无论查询难易,计算成本均随视频时长线性膨胀。例如简单的是非问答也需编码上千帧,浪费算力。
- 伪交互式方法:近期虽出现基于 Agent 的框架(如 VideoAgent),但仍依赖全局预扫描抽取稀疏关键帧,后续交互仅在已抽取的固定表示上操作,无法在推理时动态调整观察焦点。其上下文长度仍与视频时长正相关,未真正解耦推理复杂度。
- 缺乏原生主动感知:现有 Agent 将视频视为静态文件,未建模为部分可观测马尔可夫决策过程(POMDP),因此无法根据当前不确定度决定下一步观察动作(如快进、放大音频片段),导致大量冗余信息被编码。
挑战与重要性
长视频中信息高度稀疏,关键事件常仅占极小片段,高效搜索是核心难题。同时,工业部署面临严格的延迟与显存约束,现有模型的平方级注意力复杂度难以扩展至超长视频。从技术演进看,多模态系统正从单次前馈转向 Agentic 模式(如 Gemini 2.0、GPT-4V 的 Tool-use),要求模型具备主动感知与按需计算能力,否则无法支撑实时安防、长视频检索等任务。训练这种主动感知能力需设计合适的奖励信号与训练策略,否则 Agent 易陷入无效观测循环。
行业类比:与 RAG 系统用检索替代遍历所有文档类似,长视频理解中的智能体需根据查询动态选择处理哪些视听片段,而非被动编码整个视频。
核心洞察
- 将长视频理解建模为部分可观察马尔可夫决策过程 (POMDP) 并实现原生主动感知,使得计算代价与原始视频时长解耦。与普遍采用的“全览式”均匀采样或基于全局预扫描的交互式框架不同,OmniAgent 通过迭代式观察-思考-行动循环按需执行感知动作,选择性将视听线索蒸馏为持久文本记忆,从而在推理阶段无需处理与查询无关的长尾帧,这不仅降低了上下文窗口压力,更在 LVBench 等基准上以 7B 模型超越 72B 的 Qwen2.5-VL,证明了架构级效率提升。
- TAURA (Turn-aware Adaptive Uncertainty Rescaled Advantage) 利用回合级熵重新缩放优势值,精准引导信用分配到“关键发现回合”,有效缓解了多轮推理中的优势同质化问题。与标准 GRPO 将所有动作同等对待不同,TAURA 识别出模型在决策分叉处(高熵回合)的探索价值,并通过熵感知缩放强化这些转折点,从而在 Agentic RL 中更高效地优化主动感知策略,实验显示其带来的增益显著高于普通策略优化,且伴随正向测试时间扩展特性。
方法
OmniAgent 将长视频理解建模为部分可观测马尔可夫决策过程(POMDP) ,通过迭代的 Observation–Thought–Action 循环实现主动感知。
输入与状态表示
- 输入:长视频(含音频流)与用户查询。
- 状态:系统维护一个持久文本记忆(
persistent textual memory),累积每次交互中提取的视听线索,避免上下文随视频时长线性增长。
核心循环模块
- Observation(观察):根据当前策略,智能体执行按需动作(例如:在特定时间窗口采样关键帧、分离音轨、检测场景切换),并将动作执行结果转化为结构化观察描述。
- Thought(思考):智能体对观察结果进行推理,判断是否已获得充分证据来回答原始查询,或需要进一步探索。该过程依赖于当前记忆状态与查询的相关性评估。
- Action(动作):若信息不足,智能体决定下一动作(如跳转到另一时间点、请求字幕提取、进行声学事件检测),并指定动作参数(时间区间、感知模态等)。动作空间由一组丰富的视听交互算子构成(例如
seek_to、extract_frames、transcribe_audio等),通过 FFmpeg 等基础设施实现。 - Memory Consolidation(记忆巩固):每次观察后,关键发现被提炼为文本摘要并追加到持久记忆中;陈旧或冗余的记忆条目被裁剪,以控制上下文长度。
训练策略
- Agentic SFT:通过best-of-N 轨迹合成生成高质量交互轨迹。利用探索策略产生多条轨迹,再经双重质量控制(答案正确性验证 + 中间步骤逻辑一致性检查)筛选最优轨迹,用于监督微调,使模型初步学会主动感知。
- Agentic RL with TAURA:在 SFT 基础上用强化学习优化。传统优势函数(如 GAE)在多回合交互中会平滑关键决策与平凡步骤的差异;TAURA(Turn-aware Adaptive Uncertainty Rescaled Advantage) 通过回合级策略熵对优势值进行缩放——在熵高的发现回合(
pivotal discovery turns)给予更大奖励,从而精准地将信用分配给真正推动理解进展的步骤。
关键差异
与被动“一次看完”模型或依赖全局预扫描的交互方案不同,OmniAgent 将推理复杂度与视频原始时长解耦,在测试时可通过增加推理回合数以提升性能,实现正相关的 test-time scaling。
实验
实验设计
在 10 个多模态理解基准上评估,包括 VideoMME、LVBench 等,覆盖视频理解、音频-视觉推理、时间定位等任务。通过对比被动模型、大尺寸模型(如 Qwen2.5-VL-72B)和交互式框架,验证主动感知的效率。消融分析涵盖训练范式(Agentic SFT + RL)、TAURA 信用分配、测试时推理轮次扩展和视觉采样效率。
关键发现
- OmniAgent 在开源模型中达到 SOTA,7B 版本在 LVBench 上以 50.5% 准确率超过 72B 模型(47.3%),验证了小模型的潜力。
- 测试时正扩展:增加推理轮次(active perception turns)可稳定提升性能,推理复杂度与视频时长解耦。
- TAURA 优势:基于 turn-level 熵的信用分配优于 vanilla GRPO,更有效地识别关键发现轮次。
与基线对比深度解读
传统“全览”模型的计算量随帧数线性增长,而 OmniAgent 通过 agentic 动作选择关键片段,将推理成本转化为与难度相关、与时长无关。相比需要全局预扫描的交互框架,它首次原生统一了多模态感知与决策,记忆机制将视听线索浓缩为文本,避免上下文窗口无限扩大。强化学习阶段用熵引导的信用分配解决了优势同质化问题,使模型学会在关键回合投入更多探索,而非平均分配奖励。这一设计为长视频理解提供了新的工程范式:用小模型 + 多步交互替代大模型一次性推理,兼顾性能与成本。
行业影响
落地场景
OmniAgent 的主动感知能力使其特别适合处理长视频理解任务,可广泛应用于内容审核、视频搜索、智能监控、教育录播分析等需要从长时间音视频流中提取关键信息的场景。
- 视频内容平台:对电影、剧集、体育赛事等进行自动章节分段、高光检测、情节问答,支撑推荐与搜索。
- 企业级安防与零售:从数十小时的监控录像中快速检索异常事件或顾客行为,无需人工全程回看。
- 在线教育:对课程录像进行知识点索引,自动生成摘要和问答对,提升学习效率。
- 医疗影像:分析手术录像、内窥镜视频,协助医生快速定位关键操作阶段。
商业价值
OmniAgent 通过 计算量随视频时长解耦 的方式重构了长视频分析的成本结构,直接带来降本与体验提升。
- 降本:传统“全帧处理”模式的计算成本与视频长度成正比,OmniAgent 仅对与查询相关的片段执行精细感知(
on-demand actions),推理 GPU 成本可大幅下降,尤其对 1 小时以上视频优势明显。 - 体验提升:支持多轮交互式问答,用户无需预定义关键帧,模型可主动探索信息,在更少交互中给出可靠答案,产品延迟可感降低。
- 增收潜力:高效的内容理解能支撑更丰富的视频广告插入、电商直播实时选品等变现链路。
与现有产品/工作流的接口
OmniAgent 可以 轻量级 agent 配件 的形式融入现有视觉语言模型(VLM)栈,无需推翻既有基础设施。
- 模型侧:基于 Qwen2.5-VL-7B 等开源 VLM 构建,可直接替换现有视频理解模块。
- 系统侧:通过
Ray和Verl实现分布式 agent 环境,可与 Kubernetes 等编排系统对接,横向扩展。 - 工具侧:所有感知动作(如
seek、crop、describe_audio)基于 FFmpeg 实现,可无缝嵌入已有视频处理管线。 - 训练侧:Agentic SFT 与 Agentic RL 训练范式可复用现有指令数据与 RL 框架(如 vLLM),迁移成本低。
特定落地用例:
- 电商直播分析:某全球电商平台每天产生数十万小时直播回放,需自动提取商品讲解片段、价格预告、优惠券发放时刻,用于后续商品关联与推荐。OmniAgent 可接收“找出所有提到‘限时折扣’的片段并总结折扣内容”的查询,通过主动跳转与音频、视觉跨模态定位,在分钟级内完成过去需要 GPU 集群全量扫描的任务,大幅降低分析延迟和算力成本。
- 教育视频智能问答:在线教育平台对课程录像提供“搜索式学习”功能,学生可提问“老师什么时候开始讲泰勒公式?” OmniAgent 通过多轮主动感知定位到对应板书和讲解片段,并给出精准时间戳与答案,相比现有基于全局扫描的被动模型,响应速度提升同时减少 80% 以上的上下文 token 消耗,直接降低 API 调用成本,提升用户留存。
局限
- **训练与推理的环境依赖性较高**:OmniAgent 依赖基于 Ray 和 Verl 的分布式架构,并需要 FFmpeg 实现鲁棒的感知操作,这在实际部署中可能带来额外的工程复杂度与资源开销。虽然作者通过 Agentic SFT 与 TAURA 提升了训练效率,但双阶段训练流程本身依然需要大量优质轨迹采样,尤其 RL 阶段对熵的估计依赖在线 rollout,收敛稳定性尚待更严格的理论保证。对于极端长视频(如数小时监控录像),其动作空间离散化可能导致关键信息遗漏,且持久文本记忆的压缩过程会丢失精细时空关系。
- **评测基准的覆盖面与偏移风险**:论文在 VideoMME、LVBench 等十个基准上进行了评估,取得开源模型中的 SOTA 成绩,但这些基准多侧重于问答与推理,对开放式生成、细粒度动作定位等任务的覆盖不足。主动感知的效果高度依赖于预定义的动作类型(如抽取帧、音频段),若任务需求超出动作空间定义(如需要像素级操作或实时交互),模型将难以泛化。与基于全局预扫描的交互式方法相比,OmniAgent 在需要全局密集检索的任务上可能出现性能下降,因为其每一步只看到局部观测。
- **与封闭源模型及更大规模模型的比较不完整**:尽管在 LVBench 上 7B 版本超越了 72B 的 Qwen2.5-VL-72B,但实验主要局限于同一模型家族或公开权重的模型,未与 GPT-4o、Gemini 等前沿封闭源多模态大模型进行系统对比。此外,对主动感知和 POMDP 框架的消融主要围绕训练策略,未能完全拆解 POMDP 建模本身相对于常规 MDP 或固定预算扫描范式的增益,难以判断核心贡献究竟是框架设计还是训练技巧。