行业新闻

Vinci2:第一视角AI助手实现主动服务

Vinci2让AI助手基于长期记忆主动决策介入时机,配套基准与智能体,已入选ECCV 2026。

现有第一视角视频助手只能被动应答或按预设指令触发,无法基于用户历史习惯自主判断介入时机。Vinci2将主动服务形式化为“决策+生成”联合任务,提出评测基准EgoServe和免训练记忆增强智能体EgoMemo,使AI能根据长期上下文决定何时、如何主动帮助用户。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/46917c26-8d62-4e3d-9188-354b7f68af8c/053(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。前者需要 AI 助手根据当前场景服务用户,后者则需要调用跨越数天的记忆,总结用户生活规律。 然而,当前的第一人称视频助手大多停留在两种范式: 被动响应式(Reactive) ——用户单次提问,模型单次作答; 半主动式(Semi-proactive) ——用户预先给定指令,模型监测预定义事件并触发回复。二者都无法基于用户的历史、习惯与当前活动,自主判断「此刻是否真的需要打扰用户」。「第一人称视频助手在何时、以何种方式主动开口?」的问题依然有待被解决。 针对这一研究空白,来自大连理工大学、Alaya Lab 与东京大学的团队联合提出 Vinci2 ,将 主动服务(Proactive Assistance) 形式化为一个基于持续视频流的「决策 + 生成」联合任务:智能体在每个时刻不仅要感知正在发生什么,还要基于长时程累积的上下文,决定当前是否介入、如何介入。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-17原文

相关内容