华为 LFS:可学习帧选择器破解长视频关键帧选取难题
华为LFS通过轻量可学习帧选择器使大模型优先关注关键动作帧,为长视频理解提供高效新范式。
多模态大模型处理长视频时常因算力限制采用均匀采样,但关键事件分布稀疏且非均匀,容易遗漏或浪费资源。华为GTS团队提出LFS(可学习帧选择器),用仅126K参数的轻量网络为每帧打分,结合分层Top-K策略选出关键帧。在9个权威基准上取得SOTA,显著提升视频理解质量。
正文摘录
 新智元报道  【新智元导读】 多模态大模型正试图从「看画面」进化到「懂世界」。 但面对动辄数小时的真实业务长视频,所有大模型玩家都撞上了一堵极其现实的高墙:视频那么长,算力那么贵,帧,到底该怎么选? 多模态大模型正试图从「看画面」进化到「懂世界」。但面对动辄数小时的真实业务长视频,所有大模型玩家都撞上了一堵极其现实的高墙:视频那么长,算力那么贵,帧,到底该怎么选? 为了妥协算力,目前的行业惯例是「均匀采样」——让模型每隔几秒机械地「睁一次眼」。但这套看似公平的逻辑,在通信等复杂领域场景中却显得极为脆弱。因为业务事件的发生,从不按照节拍器来。  痛点:垂直业务场景的「冰与火之歌」 在专业的领域视频中,「看满全场」绝不等于「看懂细节」。关键事件在时间轴上极度「非均匀分布」,这导致均匀采样常常在两个极端里反复横跳: - 「久坐不动」的无效冗余: 比如专业培训、技术课程,一页教案可能长达十几分钟。如果均匀采样,大量近乎雷同的静态画面不仅白白烧掉算力,还会让大模型直接「看花眼」。 - 「电光石火」的瞬间遗漏: 在现网割接、机房工勘等长录像中,99% 的时间可能是无意义的静默等待,但决定成败的核心动作往往转瞬即逝。均匀采样在这种场景下,无异于大海捞针,一漏致命。