Ambient @ EgoLongQA 2026: 将长视频感知蒸馏进 Sub-2B 模型
我们介绍了参加 ECCV 2026 Wearable-AI Challenge 中 EgoLongQA 赛道的方案,在 <=2B 参数分组中以 0.8279 的成绩位列 held-out 测试集第一。 方法上,系统是一个单一的 2B 视觉语言模型,对十分钟级自我中心视频的多选题在单次贪婪前向传播(greedy forward pass)中作答。它并非蒸馏整个 agent,而是蒸馏一个工具使用型 agentic pipeline 的初级感知模块:使用经过筛选、仅保留答对样本的 teacher traces 训练小规模 student。 结果方面,该模型以 1.1% 的参数量达到大 agentic pipeline 89% 的准确率,并把基座模型从 27.1% 提升到 81.4%。 由于 2B backbone 实际含 2.2132B 参数,超出分组上限,我们将多语言词嵌入表从 248,320 行剪枝到 143,469 行,使其降至 1.9985B,同时在保留行上具有可证明完全一致的 logits。
论文精读
TL;DR 从工具型 Agent 的 junior 感知模块蒸馏出 2B 视觉语言模型,在 EgoLongQA 上以 0.8279 夺魁,并通过剪枝多语言词表压到 1.9985B 合规。
问题
第一人称长视频问答(EgoLongQA)要求模型观看约10分钟视频后回答四选一问题,问题多为两跳复合,需定位锚事件并推理相对关系。此任务对可穿戴 AI 有直接价值,但参数预算被严格限制在 ≤2B。
现有方法局限
- Agentic pipeline(如 Ambient)通过多轮采样、工具检索和 senior orchestrator 实现高准确率,但参数量达数百亿,无法部署于端侧。
- 直接微调小规模 VLM 受限于视觉编码器容量和上下文窗口,难以捕捉长时序事件依赖;base 模型准确率仅 27.1%,远低于可用水平。
- 常规蒸馏常迁移最终答案或完整 agent 行为,忽略中间感知模块的结构化知识,导致学生模型在长视频推理上泛化不足。
为什么这个问题难/重要
技术挑战在于:10分钟视频构成稀疏但时序关联的事件流,两跳问题要求模型跨越数分钟定位并关联信息;在 ≤2B 参数约束下,视觉塔与语言模型共享预算,直接限制多模态特征表达。业界对端侧长视频理解的需求快速增长,如何在低参数、单次前向、低延迟条件下逼近大模型效果,是研究重点。
行业类比
类似在 AR 眼镜或手机本地运行长视频记忆助手,需将云端多工具 Agent 的感知能力压缩为可实时推理的轻量模型。
核心洞察
- 从工具使用 agent 的中间感知模块蒸馏,比直接蒸馏最终输出更能保留长视频感知能力。多数蒸馏工作直接匹配教师模型的最终预测,但这会引入 agentic 编排中的工具选择与推理噪声。该工作选择 **junior perception module** 的 trace,仅保留回答正确的轨迹,使 2B 学生学到的是可泛化的感知与推理,而非特定 agent 策略。这解释了为何 1.1% 参数达到 89% 大模型精度。
- 参数预算略超时,修剪低频多语言嵌入表比修改模型宽度/深度更安全。2B 上限下,backbone 有 2.2132B 参数,团队将 **multilingual embedding table** 从 248,320 行裁到 143,469 行,保留行 logits 完全相同。由于嵌入行只影响对应 token,且低频词汇对视觉问答影响极小,这种裁剪几乎无损。对工业部署中常见的参数配额问题,优先裁剪词汇表比缩小 hidden size 或层数更能保持性能。
- 帧数对模型性能的影响依赖于模型容量:小模型多帧反而有害,大模型多帧有益。负结果发现,在 ≤2B 模型上增加帧数导致 accuracy 下降,而 35B 模型相同变化有帮助。这提示视觉 token 数量需要与模型处理能力匹配,小模型可能被冗余帧引入的噪声淹没。对于资源受限的边缘视频理解系统,帧采样策略应保守,而非盲目增加视觉输入。
方法
输入与任务定义
输入为约 十分钟的以自我为中心视频 与一道 四选一问题,要求单次前向贪心解码输出答案标签。
教师智能体管道
教师为 Agentic pipeline (Ambient [2]),包含三次采样 junior pass 与一个配备 clip-retrieval 工具的 senior orchestrator。该管道在分布鲁棒评估集上达到 81.4% 准确率,但参数规模远超 2B 限制。
组件级蒸馏与 Oracle 过滤
学生直接蒸馏 agent 的 junior perception module,而非整个 agent。教师 trace 经过 Oracle-filtered:仅保留教师回答正确的轨迹用于训练,避免蒸馏错误推理链。合成数据用于扩展问题分布。训练策略包括 prior corrected evaluation、resolution transfer,且仅训练 one epoch,避免小模型过拟合长视频噪声。
参数合规剪枝
学生主干为 2B 视觉语言模型,原始总参数 2.2132B,超出 ≤2B 限制。将多语言嵌入表从 248,320 行剪枝至 143,469 行后,最终参数达 1.9985B。剪枝后保留行上的 logits 与原始模型 provably identical。
输出与性能
系统在测试集上达到 0.8279 准确率,达到大型 agent 管道的 89% 精度,仅使用其 1.1% 的参数;学生将基座模型从 27.1% 提升至 81.4%(held-out)。
差异点:与常见蒸馏整个 agent 或依赖强化学习的方法不同,本工作聚焦蒸馏 agent 内部的感知子模块,并通过 oracle 过滤和容量匹配的嵌入层剪枝,使 2B 单模型在长视频问答上逼近大型 agent 的效果。
行业影响
落地场景
该技术可将长视频问答能力压缩至 2B 参数 以内的模型,适用于边缘设备上的实时视频理解。典型场景包括:
- 可穿戴 AI 助手:智能眼镜或 AR 设备录制第一视角视频,用户随时用自然语言提问,例如“我最后把钥匙放在哪个房间了?”
- 视频内容平台:对用户上传的 UGC 长视频自动生成摘要或回答观看者的定向问题,替代人工审核或大型云端模型。
- 远程协作与维护:现场工程师佩戴摄像头,系统实时回答“第三步操作后哪个指示灯应该亮起?”这类二跳问题。
商业价值
核心价值在推理成本的大幅下降。论文中的学生模型仅用大型 agentic pipeline 的 1.1% 参数 达到其 89% 准确率,可在消费级 GPU 甚至移动端 NPU 上部署。
- 降本:从需要多次采样 + 工具调用的 agent 流程,变为单次前向推理,算力需求降低数个数量级。
- 增收:为硬件厂商提供可离线运行的 AI 卖点,支撑起原本无法承担云端 API 成本的产品线。
- 体验提升:低延迟回答(单次前向)适合实时交互场景,避免用户等待多步推理。
与现有产品/工作流的接口
学生模型是一个标准 VLM,可直接替换现有 video LLM 推理模块。集成方式:
- 通过
ONNX或TensorRT导出,部署在边缘设备上。 - 在数据层面复用原 agent 的感知输出作为蒸馏数据,无需额外标注。
- 剪枝后的 embedding table 保持与原始词表兼容,可无缝接入已有 tokenizer 流程。
具体 use case:电商直播平台使用该模型对主播第一视角长视频做实时商品提问应答,例如“主播刚才展示的蓝色连衣裙是什么时候试穿的?”,直接服务用户互动,无需调用云端大模型,节省带宽与成本。
局限
- **任务范围限制**:系统仅针对 EgoLongQA 的四选一多项选择问答任务设计,蒸馏目标是 agent 的 junior perception 模块,学生模型在开放式生成、需要长程记忆或多轮交互的真实可穿戴场景中并未验证。其性能高度依赖固定格式的问题,缺乏对自由形式查询的泛化能力,因此难以直接迁移到通用视频理解助手。
- **词汇表剪枝隐患**:为满足 ≤2B 参数限制,模型从 248,320 行剪至 143,469 行,虽然保留行的 logits 一致,但剪去约 42% 的嵌入行会显著削弱未被保留语言(尤其是低资源语言和代码混合文本)的处理能力。评测集以英语为主,多语言鲁棒性未经验证,实际部署中面对全球用户时可能产生性能落差。
- **蒸馏偏差与训练不充分**:蒸馏仅使用 teacher trace 中回答正确的样本,teacher pipeline 自身的系统性偏差会被学生继承。此外训练仅进行一个 epoch(根据摘要推断),模型可能尚未收敛;实验也表明在 2B 规模下增加帧数反而降低准确率,说明学生模型对长视频中的关键帧选择高度敏感,动态场景感知鲁棒性不足。