Ambient @ EgoProactive 2026:基于视觉 grounding 监督的主动式第一人称辅助
我们提交的工作参加了 ECCV 2026 Wearable AI Challenge 的 EgoProactive 赛道,在大模型组排名第一、在 ≤2B 组排名第二。任务要求可穿戴助手在每段 8 秒的 egocentric 视频之后,判断应当介入还是保持沉默。 方法包含两个主要部分。第一,我们把介入时机重新表述为 single-token 分类:模型不再生成 interrupt<utterance 或 silent,而是预测 yes 或 no,再由这两个 token 的重归一化概率导出决策。相比自由生成,该表述使 macro-F1 提升 0.249、G-mean 提升 0.30。 第二,由于标注数据仅限于官方发布的 validation set,我们用 tool-calling video agent 检查每个片段并标注介入时间戳,以此生成额外监督。仅依赖旁白(narration-only)的替代方案规模大四倍、成本低十倍,但其迁移效果反而差于来自一个不相关真实语料的监督,说明对该任务而言 visual grounding 比标注数量更重要。
论文精读
TL;DR 将可穿戴助手介入时机重构为单 token 分类,仅预测 yes/no 并取 renormalized 概率决策,使 macro-F1 提升 0.249;并证明视觉 grounding 比标注量更关键。
问题
问题背景
可穿戴主动助手正成为具身 AI 与增强现实应用的交汇点。EgoProactive 2026 挑战定义的核心任务是:给定自我中心视频流,模型在每个约 8 秒片段后输出 interrupt 或 silent,以宏平均 F1 评估决策质量。
现有方法局限
主流做法是让视觉语言模型直接自由生成多 token 序列,如 interrupt<utterance> 或 silent。这带来两个明显问题:
- 解码时的累积误差与非确定性采样让决策边界不稳定,输出格式错误就会直接判错。
- 生成任务与分类目标错位,模型既要学格式又要学语义,收敛慢且高度依赖指令模板。
此外,标注数据仅来自发布的验证集,规模极小,难以支撑时序二分类的泛化。现有合成监督多走纯叙述路线,用自动语音描述作为弱标签,但缺少对视觉上下文的显式对齐,迁移效果有限。
为什么难/重要
干预时机是漏报与误报的极端权衡:过度沉默会错过用户求助,频繁打断则破坏任务流。这要求模型具备细粒度视频理解、意图推理与低延迟决策能力,且评测指标 macro-F1 对类别不平衡敏感。业界关注主动式 AI 助手在实时协作、远程指导等场景的落地,视觉 grounding 成为减少幻觉干预、提升信任的关键。
行业类比
类似自动驾驶中的接管提醒:系统需要在正确瞬间提醒驾驶员,既不能漏掉危险,也不能频繁报警导致警报疲劳。
核心洞察
- 将干预时机决策重构为单 token 分类,通过 yes/no 概率重归一化进行决策,显著优于自由生成方式。传统方法让模型生成 `interrupt<utterance>` 或 `silent`,但生成过程易引入格式错误和语义歧义,且需额外解析。改为仅预测 yes/no,直接取两个 token 的 logits 做 softmax,得到决策概率,避免了生成式解码的不确定性和计算开销。相比 free-form generation,macro-F1 提升 0.249,G-mean 提升 0.30,说明在 wearable 实时决策场景中,将生成问题转化为分类问题能大幅提升稳定性和效率。
- 工具调用视频 agent 生成的视觉监督,其迁移效果优于四倍规模且成本低十倍的 narration 标注,证明视觉 grounding 比标注量更重要。论文中 agentic route 直接检查视频并分配干预时间戳,而 narration route 仅用文本描述,后者迁移更差,甚至不如无关真实语料。这挑战了“数据规模优先”的假设,表明在 egocentric 干预任务中,视觉上下文是判断时机的关键,仅靠语言无法捕获。对工程实践的启示是:合成数据生成应优先保证信号与目标模态对齐质量,而非单纯追求数量或降低成本。
方法
方法概览
输入 为穿戴设备连续采集的自我中心视频流,按约 8s 片段切分,同时携带用户开场 query。模型对每个片段输出二元决策:是否立即打断并给出短 utterance。
关键模块一:单 token 分类重构
传统方案让模型直接生成 interrupt <utterance> 或 silent,本质是自由文本生成,类别概率难以校准且偏向高频输出。本文改为预测 yes / no 两个 token,将两者对数概率重归一化后作为打断概率,从而把决策问题压缩为极小词表分类。实验显示该重构将 macro-F1 提升 0.249、G-mean 提升 0.30。工程上,这消除了生成式 token 序列长度波动,降低延迟并稳定置信度。
关键模块二:视频 agent 生成的视觉接地监督
官方标注仅限验证集,因此构造额外监督:
- tool-calling video agent 逐片段检查视觉内容,输出干预时间戳作为伪标签;
- 对比 narration-only 方案:数据量多 4 倍、成本低 10 倍,但迁移效果更差,甚至不如无关真实语料监督。
这强烈提示 视觉接地 比标注规模更关键。伪标签生成以真实视觉信号为依据,避免纯文本叙述带来的偏差。
训练细节与输出
输入侧拼接视频帧与 query;≤2B 赛道做 词表剪枝 以减少内存和算力。最终输出二元决策,直接触发穿戴助手的打断动作。
跟生成式打断方法不同:本文将时序决策重构为单 token 重归一化分类,并用视频 agent 伪标签强化视觉接地,而非单纯扩大叙述型数据规模。
实验
实验设计
任务按 8 秒 自我中心视频片段逐段决策 interrupt 或 silent,官方指标为两类 macro-F1,辅助关注 G-mean。标注数据仅限发布验证集,因此构建两条合成监督路径:
- 工具调用视频智能体 对剪辑分配干预时间戳;
- 纯 narration 路线 生成四倍量级、十分之一成本的数据。
最终采用 verbalizer 单 token 分类训练,并对 <=2B 模型做词汇表剪枝。
关键发现
将输出从 interrupt<utterance> / silent 改为预测 yes / no 并取重归一化概率,macro-F1 提升 0.249,G-mean 提升 0.30,相对自由文本生成显著稳定。工具调用视频智能体产生的视觉监督迁移效果优于纯 narration,尽管后者数据量更大且成本更低;无关真实语料迁移同样优于 narration-only,说明 视觉grounding 比标注体量更关键。负结果:改变合成数据混合与增大 backbone 均未进一步提升。
与基线对比解读
自由文本生成易受解码偏差干扰,单 token 分类将干预时机简化为二分类,减少序列不确定性,对实时可穿戴场景更可控。这提示工程上优先约束输出空间与标注质量,而非单纯依赖更大模型或更多弱标注。排序第一 / 第二表明该策略在参数规模与推理成本之间取得平衡。
行业影响
落地场景
该技术可嵌入 可穿戴 AI 助手(AR 眼镜、智能耳机、智能手表),用于需要实时、上下文感知的干预场景。例如:工业维修员佩戴 AR 眼镜进行设备检修,模型判断是否在关键步骤前发出语音提示;外科手术培训中,助手在学员操作偏离时插话纠正;烹饪或 DIY 场景下,智能眼镜只在用户卡顿时给出步骤指引。核心是 主动式时机判断,而非被动问答。
商业价值
减少 误干预 带来的用户体验损伤和任务失败风险。传统生成式 VLM 自由生成 interrupt / silent 引入额外语义歧义,本文的 single-token classification 直接优化 宏 F1 和 G-mean,显著提升决策可靠性。同时,用视频 agent 生成视觉监督 的方法降低了对人工标注的依赖,数据成本可降低数倍至十倍(论文中 narration-only 方案更便宜但迁移差)。对产品公司而言,这意味着能以更小标注预算获得可部署的主动干预模型。
与现有工作流集成
模型规模可压缩至 ≤2B,适合部署在 边缘设备 上,与现有 video streaming pipeline 结合:视频分段后输入模型,输出 yes / no 概率,超过阈值触发后续生成。可以替换现有基于规则或纯生成式的干预判断模块,作为 在线决策器 插入到 agent 框架(如 tool-calling video agent 的在线版)。工程上,单 token 分类的推理开销极低,甚至可在端侧 CPU 运行,适合低延迟实时系统。
具体 use case 举例:
- 企业级 AR 远程协助平台:集成该模型后,系统只在用户出现错误操作或停顿超过阈值时推送专家远程提示,减少专家认知负担。
- 教育科技:在技能培训(如实验室操作)中,智能眼镜根据学习者动作判断是否需要介入,提升学习效率。
局限
- **合成监督的可靠性未充分验证**:使用 tool-calling video agent 生成干预时间戳,但论文未报告 agent 标注与人工标注的一致性、错误类型或置信度校准。agent 可能受视觉语言模型自身偏差影响,在遮挡、快速动作等长尾场景产生系统性错误,这些错误会直接进入训练目标。与 narration-only 的对比虽显示视觉 grounding 更重要,但未控制 agent 模型容量与提示词差异,难以排除是 agent 能力更强而非视觉信息本身带来提升。
- **单 token 分类的简化限制**:将干预决策压缩为 `yes`/`no` 二分类并重归一化 token 概率,显著提升 macro-F1 与 G-mean,但放弃了生成真实 `interrupt <utterance>` 的路径。实际穿戴式助手需同时判断干预时机与话语内容,若 utterance 生成质量不足,即便时机正确也会影响用户体验。论文未评估该分类器与后续语言模型在端到端流程中的组合方式,因此该改造成果主要适用于评测指标,离完整系统仍有差距。
- **实验评估层面的局限**:论文主要基于挑战赛验证集与排行榜,未做跨用户、跨任务的稳定性消融;负结果提到增大骨干网络收益有限,但可能受数据量或训练策略限制。同时,仅与自身 free-form generation 基线比较,未展示与其他参赛方法的直接对比,因此难以判断该单项改进在更广泛设置下的通用性与鲁棒性。