MOSS-VL 技术报告
MOSS-VL 是一个开放视觉语言模型系列,将实时交互——边生成边感知——视为一等能力。其设计贯穿整个技术栈:语言解码器仅通过门控交叉注意力 访问视觉信息,使模型在生成的同时自然看到新输入帧;一个合成的交互语料 监督何时说话、何时静默、何时修正;分阶段课程将实时相关训练集中在强离线基础之上的一个轻量最终阶段。 离线方面,MOSS-VL-Instruct 在同等规模下具有竞争力,并在时态推理视频集上领先。在四个流式基准上,MOSS-VL-Realtime 在开源流式模型中平均分最高(三个第一、一个第二),并横扫三个直接测试主动行为的子集——在 OmniMMI Proactive Alerting 上达到 66.0,而最强基线仅为 37.5。尽管有 11.3B 参数,但视觉 token 不进入解码序列,随着视觉上下文增长,MOSS-VL 相对同主干 Qwen3-VL-8B 的首 token 时间优势从 2.8 倍扩大到 5.1 倍。我们已发布全部五个检查点、训练课程和实时推理代码。
论文精读
TL;DR MOSS-VL 是一系列开源视觉语言模型,将实时交互作为一等能力:解码时通过门控交叉注意力持续感知视频帧,学习何时发言/沉默/修正;在流式基准上取得最佳平均表现,且 time-to-first-token 优势显著放大至 5.1 倍。
问题
问题背景
实时视频理解正从“看完整个片段再回答”转向流式交互场景。AI 助手需要持续观看未完结的视频流,自主判断何时开口、保持沉默或修正已说内容。
现有方法局限
主流的开源视觉语言模型在架构和训练数据上存在明显约束:
- 架构层面:多数模型把视觉 token 拼接进解码序列,语言模型自回归生成时无法注入后续帧,视觉状态在生成开始后即冻结。因此模型不能“边看边说”,只能等整个视频结束后离线推理。
- 训练信号:公开指令数据几乎不包含“何时发言 / 沉默 / 修正”的标注,模型学不到主动交互的时机,实际表现偏被动应答或频繁抢话。
- 延迟问题:视觉 token 混入输入序列导致时间到首 token 随视觉上下文线性增长,在长视频流中难以满足实时性。
为什么这个问题难 / 重要
实时交互要求模型在每个生成步骤都能获取最新视觉信息,同时保持长上下文记忆和因果解码约束,这与现有离线 VLM 的设计前提冲突。门控交叉注意力 等改造会引入新的计算模式,需要针对性优化推理框架;而“何时发言”本身是稀疏、高度场景依赖的决策,很难通过静态数据集覆盖。业界对实时视觉语言交互的关注度持续上升,涉及视频会议辅助、具身智能、远程协作等场景,对低延迟与主动性的要求远超传统问答。
行业类比
就像自动驾驶系统不能等整段行程视频结束后再做决策,实时视频助手也需要像驾驶员一样持续感知路面并即时输出动作,而不是事后写一份行车报告。
核心洞察
- 通过门控交叉注意力将视觉 token 排除在解码序列之外,是 MOSS-VL 实现“边生成边感知”且不拖慢首 token 生成的核心架构决策。同类 baseline 如 Qwen3-VL 通常把视觉 token 直接拼进序列,视觉上下文越长,解码器在生成前需要处理的前缀越长,延迟随之上升;而 MOSS-VL 的架构使 TTFT 优势从 2.8 倍扩大到 5.1 倍,证明实时场景下序列外视觉注入具有显著可扩展性。
- 将实时交互行为(何时说话、保持沉默、修订已生成的回答)视为可监督学习的任务,并通过合成交互语料与阶段性课程单独训练,是 MOSS-VL 方法论上区别于多数流式模型的地方。现有流式模型常依赖规则触发或对离线模型做在线微调,容易破坏基础能力;MOSS-VL 只在最后轻量阶段注入实时特定数据,离线 Instruct 模型保持竞争力,验证了“离线强基础 + 轻量实时适配”的可行路径,对工业部署有直接借鉴价值。
方法
输入
视频帧流与时间戳,按长短时程送入模型;用户/环境事件触发主动响应。
关键模块
- 语言解码器仅通过 Gated Cross-Attention 访问视觉特征,视觉 token 外置于自回归序列,生成期间可逐帧看到新画面,天然支持实时交互。
- XRoPE 把旋转位置编码扩展到时间维度,并叠加绝对时间戳,区分事件先后与间隔。
- Realtime-SFT 使用合成交互语料监督
speak/stay_silent/revise三类行为,配合 Mode Control 将实时特定训练集中到轻量末阶段。 - 课程训练:前四阶段构建离线基础(视觉-语言对齐、大规模多模态预训练、高质量预训练、长上下文退火),最后阶段只注入实时交互数据,避免损伤离线能力。
输出
流式文本 token,可在生成中根据新视觉证据修订回答或触发主动提醒;离线 checkpoint 仍兼容常规 VQA/视频理解。
差异点
与主流 VLM 将视觉 token 拼入解码序列不同,该方法把视觉编码器外置为交叉注意力 KV 源,视觉上下文增长时首 token 延迟优势被放大而非抵消。
实验
实验设计
MOSS-VL 采用分阶段课程,将实时特定训练集中在最后一个轻量阶段,基于强离线基础。评估涵盖离线基准与四个流式基准,重点考察主动行为(如 OmniMMI Proactive Alerting)和推理效率(TTFT)。对比基线包括开源流式模型和同 backbone 的 Qwen3-VL-8B。
关键发现
- 离线表现:MOSS-VL-Instruct 在可比规模下具有竞争力,在时间推理视频集上领先。
- 流式表现:MOSS-VL-Realtime 在 4 个流式基准中 3 个取得最佳平均分,其中 OmniMMI Proactive Alerting 得 66.0,远超最佳基线的 37.5,提升 28.5 分。
- 推理效率:视觉 token 在解码序列外,11.3B 参数下 TTFT 优势从 2.8x 扩大到 5.1x(对比 Qwen3-VL-8B),随视觉上下文增长而更加显著。
基线对比解读
在主动行为子集上的大幅领先,表明合成交互语料和课程学习有效教会模型何时说话、何时沉默、何时修正,而非仅被动响应。与 Qwen3-VL-8B 的 TTFT 对比,归因于 gated cross-attention 使视觉 token 不进入解码序列,降低每步计算量;长上下文下优势扩大,验证了该架构在实时场景中的可扩展性。
行业影响
落地场景
MOSS-VL 的实时感知与生成能力适用于需要低延迟视频交互的产品。两个典型场景:
- 直播电商:模型作为实时导购,在主播讲解过程中自动补充产品细节、提醒库存或优惠,回答弹幕问题,提升转化率。
- 安防监控:持续分析视频流,仅在检测到异常事件(如闯入、跌倒)时主动告警,减少人工盯屏,降低漏报。
商业价值
核心价值来自 time-to-first-token 的显著降低:论文显示同 backbone 下较 Qwen3-VL-8B 从 2.8× 扩展到 5.1×。更快的首 token 意味着更低的交互延迟,能支撑更高的并发与更好的实时体验。在 OmniMMI Proactive Alerting 上 66.0 vs 37.5 的领先,说明模型可替代部分人工实时监控,直接节省人力成本;流式推理中视觉 token 不进入 decoded sequence,也降低单请求显存,提升 GPU 利用率。
集成接口
模型开源权重与推理代码,可通过 gated cross-attention 架构自然接入流式视频 pipeline。现有产品可保留语言 backbone,仅替换视觉交互层,迁移成本相对可控。推理服务可对接标准流式协议(如 WebRTC / WebSocket),并结合 vLLM 等框架部署。由于视觉 token 独立于生成序列,长视频上下文下仍能保持低延迟,适合嵌入现有实时音视频 stack。
局限
- **实时交互评估覆盖有限**:论文在四个流式基准上验证了 MOSS-VL-Realtime 的优势,但合成交互语料与现有基准主要聚焦于特定场景(如 OmniMMI Proactive Alerting)。真实世界中的交互模式更加多样,包括多人对话、重叠语音、非言语信号等,模型在这些长尾情境下的稳健性尚未被充分检验。此外,论文未报告在噪声输入、网络延迟波动或低帧率视频流下的性能退化情况。
- **门控交叉注意力可能牺牲部分视觉理解深度**:将视觉 token 排除在解码序列之外显著降低了时间到首个 token 的延迟,但该设计可能限制了视觉信息与语言表征的深度融合,导致在需要细粒度视觉推理(如小物体识别、复杂场景关系理解)的任务上效果弱于全注意力模型。作者仅在部分离线基准上显示竞争力,并未系统对比在相同视觉编码器下全注意力变体的性能差距。
- **模型参数与推理成本仍偏高**:MOSS-VL 总参数量为 11.3B,虽然视觉 token 不进入解码序列,但交叉注意力计算仍依赖于视觉编码器的输出缓存,对显存和计算资源提出一定要求。论文未给出在消费级 GPU 或边缘设备上的实时推理延迟数据,部署门槛仍可能阻碍广泛应用。同时,与同 backbone 的 Qwen3-VL-8B 相比,MOSS-VL 引入了额外的视觉编码与门控机制,训练和推理框架的复杂度更高,社区适配成本需要进一步降低。