北大与华为提出TaRO框架,优化视频时序推理
TaRO框架教视频大模型真正‘看时间’,通过强化时序感知推理显著提升零样本视频时序定位准确率。
针对现有视频大模型推理肤浅、缺乏时序证据的问题,北大与华为提出TaRO框架。它通过模板化推理探索提供初始指导,用时序敏感度奖励确保推理锚定关键帧,并采用渐进式课程学习。在多个公开基准上取得零样本最优性能。
正文摘录
.jpg)  本文的第一作者为北京大学王选计算机研究所博士生郑明航,通讯作者为助理教授刘洋。团队近年来在 TPAMI、CVPR、ICCV、ICML 等顶会上有多项代表性成果发表,并和国内外知名高校、科研机构广泛开展合作。 本文主要介绍该团队和华为中央媒体技术院在多模态视频理解与时序定位领域的最新研究成果。 该工作针对现有基于强化学习的视频大模型在推理过程中往往产生肤浅推理,且无法为精确的时序定位提供有效指导的问题,提出了全新的时序感知推理优化(Temporal-Aware Reasoning Optimization,TaRO)训练框架。该方法显式地增强了模型带着时间思考的能力,在多个公开基准上取得了最先进的零样本性能。目前相关代码已开源。