Kwai Keye-VL-2.0 技术报告
我们介绍 Kwai Keye-VL-2.0-30B-A3B,一个开源的混合专家(MoE)多模态基础模型,旨在推进长视频理解和智能体智能。为应对小时级视频中存在的超长上下文、信息冗余及高昂计算成本等挑战,Keye-VL-2.0 首次将 DeepSeek Sparse Attention(DSA) 适配到基于 GQA 的多模态架构中,支持无损的 256K 上下文处理,同时捕获关键帧和长程时间依赖。该架构由高度优化的训练和推理基础设施支撑,包括可扩展视频 I/O、异构 ViT-LM 并行以及定制的 DSA 内核,显著提升吞吐量并降低计算开销。 为解决多任务对齐过程中的灾难性遗忘问题,我们引入了跨模态多教师同策略蒸馏(MOPD),搭配 Context-RL 和 Video-RL。通过将同策略 rollout 中的密集 token 级教师反馈蒸馏回仅激活 3B 参数的 MoE 骨干,Keye-VL-2.0 原生支持跨代码、工具和搜索场景的高级智能体协作,并具备多模态自我纠错能力。 在视频理解、时间定位、推理、STEM 及智能体等基准上的广泛评估表明,Keye-VL-2.0-30B-A3B 在相似规模模型中达到了最先进性能,尤其在 TimeLens 上的细粒度时间定位以及 Video-MME-v2 和 LongVideoBench 上的长视频理解任务中表现突出。我们释放模型检查点,以加速社区向可扩展、鲁棒的多模态智能体应用迈进。
论文精读
TL;DR Kwai Keye-VL-2.0为开源MoE多模态模型,首次将DeepSeek稀疏注意力适配到GQA架构,实现256K无损长视频理解;通过跨模态多教师在线蒸馏,仅3B激活参数便可支撑代码、工具、搜索等多场景Agent协作。
问题
问题背景
多模态基础模型正从短片段理解迈向小时级长视频 分析,以支持更复杂的 代理智能(agentic intelligence)场景,如工具调用、代码生成与反思。
现有方法局限
当前主流方法多基于稠密自注意力,其计算复杂度随序列长度二次增长,导致:
- 上下文长度受限:难以无损扩展到 256K 级别,信息丢失严重;
- 视觉冗余处理低效:对小时级视频均匀采样会错过关键帧,而稀疏采样又破坏长程时序依赖;
- 任务间遗忘:多阶段对齐(理解 / 推理 / 代理)常导致前阶段能力退化,缺乏有效的跨任务知识迁移;
- 稀疏注意力适配空白:现有稀疏注意力(如局部窗口)主要为纯文本设计,未针对 GQA 多模态架构 优化,无法高效融合视觉 token 与文本 token。
为什么这个问题难且重要
技术挑战 在于需要同时满足:
- 超长上下文的无损处理;
- 计算成本可控,适配 MoE 架构的推理效率;
- 保留细粒度时空信息以支持精确时间定位。 业界关注度 源于长视频理解是通往通用视觉智能的关键瓶颈,自动驾驶、安全监控、媒体分析等应用迫切需求能自主对长视频进行多步推理和工具调用的模型。
行业类比
类似从数小时驾驶记录中定位异常瞬间,要求模型既拥有全局记忆,又能像搜索引擎 般精准索引稀疏关键事件。
核心洞察
- **首次将 DeepSeek Sparse Attention 适配到 GQA 多模态架构**,使模型能以稀疏注意力高效处理 256K 长视频上下文。相比传统密集注意力或简单抽帧,该方法在保持关键帧敏感度的同时大幅降低计算开销,突破了长视频理解中信息冗余与算力瓶颈,为稀疏注意力在视觉-语言模型中的实用化提供了可行路径。
- **跨模态多教师在线策略蒸馏(MOPD)** 解决了 MoE 模型在多任务对齐时的灾难性遗忘问题。通过将在线采样产生的密集 token 级教师反馈蒸馏回仅激活 3B 参数的 MoE 骨干,模型能在代码、工具、搜索等智能体场景中保持原有能力不退化。这区别于离线蒸馏或单教师方案,实现了多模态、多任务条件下的稳定强化学习对齐,为构建通用智能体提供了新的训练范式。
方法
Kwai Keye-VL-2.0 遵循 输入多模态信号 → 视觉编码 → 长上下文稀疏建模 → 多教师蒸馏策略 → 任务输出 的路线,在 MoE 架构上实现长视频理解与智能体协作。
输入与视觉编码
模型接收图像、视频和文本。视觉编码采用 Native-Resolution Vision Encoder,引入 2D RoPE 自适应位置编码和序列打包,保证原生分辨率下的高保真表示。统一视觉编码 模块将图像与视频帧映射到语言模型可消化的 token 序列,构成多模态联合输入。
核心模块:面向 GQA 的 DSA 长上下文建模
为处理小时级视频,Keye-VL-2.0 首次将 DeepSeek Sparse Attention (DSA) 适配到 GQA 多模态架构。
- MQA-Style Lightning Indexer:快速定位关键 token,生成稀疏注意力索引。
- GQA Sparse Aggregation:在分组查询注意力基础上执行稀疏聚合,维持长程依赖的同时大幅降低计算。
- Dense Warm-up and Sparse Adaptation:先用密集注意力预热训练,再逐步切换至稀疏模式,实现无损 256K 上下文处理。
训练流程与蒸馏策略
训练分预训练和后训练阶段。
- 预训练:投影器初始化 → 通用多模态预训练 → 多任务能力注入(高级 OCR、数学/STEM、GUI、定位计数等)→ 长上下文扩展 → 视频预训练课程(场景级密集描述、多样时间定位数据)。
- 后训练:监督微调与合成 Chain-of-Thought 后,进入 多专家强化学习(通用 RL、定位专家、空间专家、数学专家等),以及视频 RL 和智能体 RL(编码、工具使用、搜索)。
- Cross-Modal Multi-Teacher On-Policy Distillation (MOPD):从多个教师模型的在线策略回滚中蒸馏密集 token 级反馈到仅激活 3B 参数的 MoE 骨干,结合 Context-RL 和 Video-RL 缓解多任务对齐中的灾难性遗忘,原生赋予模型多模态自我校正与跨场景智能体协作能力。
输出
模型直接输出文本或代码,支持长视频问答、细粒度时间定位、多模态推理、工具调用等任务。
与同类方法的差异:区别于单独训练智能体模块或依赖密集注意力的方案,Keye-VL-2.0 通过 DSA-on-GQA 与 MOPD 在稀疏激活 MoE 上统一了长视频理解和智能体智能,实现了效率与性能的平衡。
实验
实验设计
模型在多个维度接受全面评估,覆盖长视频理解、时间定位、推理、STEM 与智能体任务。核心基准包括 Video-MME-v2、LongVideoBench 和 TimeLens,并与同规模开源多模态模型进行对比。此外,还单独评估了代码生成、工具调用及搜索等智能体能力,验证模型在复杂协作场景下的表现。
关键发现
- 长视频理解领先:在 Video-MME-v2 与 LongVideoBench 上,Keye-VL-2.0-30B-A3B 取得同类模型最优结果,证明 DSA 稀疏注意力 对小时级视频的有效性。
- 时间定位精准:TimeLens 上的细粒度时间定位表现突出,显示模型能精准捕获长序列中的关键帧与长程时序依赖。
- 智能体协作涌现:仅激活 3B 参数的 MoE 骨干,通过跨模态多教师在线策略蒸馏,即可支撑代码、工具使用和搜索等多步协作,且具备多模态自校正能力。
与基线对比解读
相较于采用标准稠密注意力的模型,Keye-VL-2.0 的核心创新在于将 DeepSeek Sparse Attention (DSA) 适配到 GQA 架构,实现无损 256K 上下文处理,大幅降低计算开销,这是其在长视频任务上胜出的关键。同时,Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) 与 Context-RL、Video-RL 相结合,有效缓解多任务对齐中的灾难性遗忘,使模型在通用视觉语言任务上也保持竞争力。这些设计让激活参数量仅 3B 的模型,在多项基准上超越了许多更大规模的密集模型。
行业影响
落地场景
Kwai Keye-VL-2.0-30B-A3B 的核心能力直指长视频理解与 Agentic 智能,为以下场景提供直接支撑:
- 内容平台长视频分析:小时级视频的自动摘要、章节切分、细粒度时间定位,可应用于视频搜索优化、违规内容审核与个性化推荐。
- 多模态 Agent 系统:模型内建的 工具使用、代码执行 和 搜索能力,配合 自我修正 机制,使其能担任复杂的自动化助手,例如市场分析报告生成、交互式技术文档查询。
- 智能监控与自动驾驶:利用 256K 上下文 和 稀疏注意力 高效处理长时序视觉数据,实现关键事件回溯与长周期行为分析。
商业价值
从商业视角看,该模型的主要价值线在于 降本 与 体验提升:
- 降本:MoE 架构仅激活 3B 参数,配合 DSA 稀疏注意力,将长视频处理的计算开销降至常规密集模型的几分之一,直接减少推理集群的 GPU 小时消耗。开源权重进一步省去自行预训练的成本。
- 体验提升:对时长 1 小时以上的视频实现 无压缩 256K 上下文 精准理解,可提供更细粒度的内容索引和问答,显著提升用户粘性与付费转化(如视频平台会员权益)。Agent 能力的加入可替代人工完成多步信息整合任务,提升企业服务效率。
与现有产品 / 工作流的接口
模型以 开源 checkpoint 形式交付,集成路径清晰:
- 推理服务化:原生提供 异构 ViT-LM 并行 与 定制 DSA 内核,可直接部署于 vLLM/TGI 等主流推理框架,对上暴露 OpenAI-compatible API,无缝接入现有的 LangChain、AutoGen 等 Agent 编排管道。
- 数据飞轮:平台可借助 跨模态多教师在线策略蒸馏 (MOPD) 的思想,用较少人工标注持续微调模型,形成“模型生成→人工/规则反馈→蒸馏回模型”的闭环,适应垂直场景。
具体落地用例:
- 短视频/直播平台的智能运营:自动为 1-2 小时的直播回放生成带时间戳的亮点片段、商品讲解节点,并支持用户通过自然语言搜索“三分钟前介绍那件红色外套的片段”,直接提升商品点击率。
- 企业级研发助手:在代码仓库中结合 Tool Use 与 Search RL,根据长 issue 描述自动定位相关代码段、运行测试脚本并提交修复 PR,实现从 issue 到 patch 的半自动化闭环。
局限
- **MOPD 训练范式复杂度高**:Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) 需要维护多个教师模型并进行 on-policy 蒸馏,显著增加了训练管线的计算开销和工程复杂度。论文未给出不同教师数量或蒸馏温度对性能的系统消融,也未分析教师模型选择失败时的退化风险。Context-RL 与 Video-RL 的联合优化可能引入奖励冲突,训练稳定性在更大规模或不同领域数据上仍有待验证。
- **稀疏注意力的信息遗漏风险**:将 DeepSeek Sparse Attention (DSA) 适配到 GQA 架构虽实现了 256K 上下文,但稀疏模式可能丢弃对细粒度时序推理至关重要的帧间密集关联。论文主要展示长视频理解指标,未提供与全注意力 baseline 在信息保持率上的定量对比,也未讨论注意力稀疏度与任务类型的敏感关系,可能导致在快速动作定位、跨帧因果推理等场景中出现性能损失。
- **Agent 能力评估覆盖面不足**:目前 agentic 能力的评估局限于 Code、Tool、Search 三项基准,缺少对多轮交互、不确定环境决策、安全对齐以及幻觉控制的评测。模型在真实 agent 部署中的自我纠错有效性、知识更新策略和长程任务一致性仍缺乏大规模验证,从实验室指标到实际系统的泛化性尚不明确。