CogniRoute: 学习在全模态模型中路由社交证据
全模态模型能够处理视频、音频和文本,但对多种模态的统一访问并不保证模型使用正确的证据。这一差距在社交视频问答中尤为明显,答案可能依赖于手势、语调、时间线索或言语与视觉表达之间的不一致。我们提出 CogniRoute,一个模式引导的混合专家(Schema-Guided Mixture-of-Experts)框架,用于社交全模态推理。 CogniRoute 使用训练时认知模式,通过跨模态关系、推理需求和时间范围对每个示例进行分解,并在监督微调期间将全局路由签名与此结构对齐。我们进一步引入路由感知强化学习,联合优化令牌生成和专家分配,奖励包括答案正确性、模态一致推理和认知时间接地。为支持训练和评估,我们构建了 OmniSocialBench,一个诊断性社交视频QA资源,包含11.8万个结构化训练示例、接地理推理轨迹、模式标签、时间证据跨度以及人工验证的评估集。 CogniRoute 在 OmniSocialBench 上达到 59.38% 的平均准确率,比最强的专有基线提高15.33个百分点,比最强的开源全模态基线提高26.77个百分点,最大的改进出现在需要音视频协调、冲突解决和时间接地社交推理的问题上。
论文精读
TL;DR CogniRoute 通过认知模式引导的 MoE 路由与路由感知强化学习,显著提升多模态社会视频问答中的跨模态推理与时间对齐能力。
问题
问题背景
全模态模型(omni-modal models)能够同时接收视频、音频和文本,但统一访问多模态并不保证模型能够正确选择和使用关键证据。尤其在社交视频问答场景中,答案可能依赖于一个手势、语调变化、时间线索或言语与视觉表达之间的不一致,这对模型的细粒度多模态推理能力提出了更高要求。
现有方法的局限
当前全模态模型主要采用基于 Transformer 的统一编码器,将所有模态映射到共享表示空间,然后通过通用解码器生成答案。但在社交推理中,这种方法存在三个关键局限:
- 证据忽略与混淆:模型常过度依赖单模态(如文本)而忽略其他模态(如视觉动作),或在多模态线索冲突时无法进行有效冲突消解。
- 推理粒度缺失:社交问答往往要求时序定位(如“说话者在哪个时间点露出了惊讶的表情”)和跨模态关系推理(如“他的语气与手势是否一致”),通用模型缺乏针对这些细粒度推理需求的显式架构设计。
- 路由与优化割裂:现有的专家混合(MoE)策略通常在预训练或微调时使用静态路由,没有对推理过程中的模态选择行为进行专门优化,导致路由模式与问题所需的证据类型脱节。
为什么这个问题难且重要
社交视频理解是迈向通用助理、情感计算和人机交互的关键障碍,因为:
- 多模态时序对齐:不同模态的信号在时间轴上存在异步或重叠,模型需要精确捕捉事件的时间跨度(temporal span)并跨模态关联。
- 隐式社交信号:如微表情、语调变化等线索往往转瞬即逝,且缺乏文本标注,模型必须具备从弱监督信号中自主发现证据的能力。
- 推理可解释性:在社交场景中,不仅需要答案正确,还要能指出依据哪些模态的哪些片段,这对模型的可信度和调试至关重要。 业界对该方向关注度持续升高,如最近的 Video-LLaMA、VideoChat 等项目都在探索视频多模态问答,但仍未专门针对社交推理进行架构创新。
行业类比
类似于自动驾驶需要融合摄像头、雷达和激光雷达并动态决定“此时该看哪一个传感器”,全模态社交 AI 也需要一个动态证据路由机制来决定“此时该相信语音、动作还是上下文”,这正是 CogniRoute 的动机。
核心洞察
- Schema-guided Mixture-of-Experts 路由将社交视频问答解耦为可学习的模态选择与推理阶段。现有全模态模型虽能访问多模态信息,但缺乏机制决定“何时关注音频、何时关注视觉”,在多模态冲突或时序依赖场景下表现不佳。CogniRoute 通过认知 schema 分解每个样本的跨模态关系、推理需求和时间范围,并对齐全局路由签名,让模型学会动态激活相应专家,大幅提升音视频协调与冲突解决的准确率。
- 路由感知强化学习将推理路径(而非仅最终答案)纳入优化目标,弥补了传统监督学习仅优化 token 分布、忽略多步推理质量的问题。CogniRoute 联合奖励答案正确性、模态一致推理和认知时序 grounding,使专家分配策略在生成过程中显式考虑证据的时间定位与跨模态一致性,在需要时序推理的社交问题上显著超越仅用答案监督的基线。
方法
输入与预处理
模型接收社交视频的三元输入:原始视频帧、同步音频流和文本问题。视频帧与音频波形经各自预训练编码器投影为时序对齐的 token 序列,文本问题独立编码后与多模态 token 拼接,构成统一的序列表示。
核心模块
1. 认知模式分解(Cognitive Schema Factorization)
在训练初期,每个社交 QA 样本被人工或自动标注一层模式化标签,该标签分解为三个维度:
- 跨模态关系:指明视听信号是一致、互补还是冲突;
- 推理需求:需关注手势、语调或跨模态矛盾;
- 时序范围:关键证据对应的时间区间。
这些标签仅用于训练,不参与推理,目的是为后续路由提供结构化的认知先验。
2. 全局路由签名对齐(Global Routing Signature Alignment)
框架内置一组可学习的全局路由签名,每个签名代表一类认知模式。在监督微调(SFT)阶段,每个样本的 token 序列经过 MoE 层时,门控网络计算输入与各签名的相似度并生成专家权重。额外引入一个对齐损失,迫使输入的路由概率分布逼近其所属样本的认知模式分布,从而将认知结构“写入”路由签名。
3. 路由感知强化学习(Route-Aware RL)
在 SFT 之后,模型进入 RL 精调阶段,联合优化答案生成和专家路由。奖励函数由三项组成:
- 答案正确性:生成答案与标注的匹配度;
- 模态一致性推理:模型推理路径(如注意力权重)是否与真实模态证据对齐;
- 认知时序定位:模型关注的时间片段是否覆盖标注的时序证据区间。
策略梯度同时更新生成器参数和门控网络,使路由策略主动选择与当前推理需求一致的专家组合。
输出
推理时,模型仅依赖输入的多模态序列和训练好的路由签名,无需认知标签,直接生成文本答案。
与同类方法的差异
相比于标准 MoE 中路由仅由输入隐式决定,CogniRoute 通过认知模式显式引导路由,并创新性地将时序证据定位作为 RL 奖励,使得模型在社交视频这类需跨模态冲突推理和时序依赖的场景中,获得更鲁棒的证据利用能力。
实验
实验设计
CogniRoute 在新建的 OmniSocialBench 上训练与评估,该数据集包含 118K 结构化训练样本,每个样本配有推理轨迹、认知模式标签及时间证据跨度,并设有经人工校验的测试集。模型训练分为两个阶段:(1) 监督微调,利用分解后的认知模式(跨模态关系、推理需求、时间范围)对齐全局路由签名;(2) 路由感知强化学习,联合优化 token 生成与专家分配,奖励信号结合答案正确性、模态一致性推理及认知时间基础。
关键发现
- 整体准确率 达 59.38%,远超闭源与开源基线。
- 最大提升 出现在需要 音视频协同、冲突消解 与 时间基础社会推理 的问题上,说明模型能有效利用多模态证据。
- 消融实验显示,认知模式分解与路由感知强化学习均对性能有显著贡献,尤其在复杂推理场景下。
基线对比深度解读
与最强闭源模型相比,提升 15.33 个百分点;与最强开源全模态模型相比,提升 26.77 个百分点。这一差距在以往模型难以处理的 多模态冲突(如口头表述与视觉表达不一致)和 时序依赖 问题上尤为突出。CogniRoute 的 Mixture-of-Experts 路由机制通过训练时注入认知模式先验,能够动态选择最相关的证据通路,而非简单融合所有模态,从而避免冗余或误导信息。这为全模态社会推理任务提供了新的架构范式,启示工程实践:针对复杂多模态对齐问题,显式建模推理需求、跨模态关系与时间结构,比增大模型规模或暴力融合特征更高效。
行业影响
落地场景
CogniRoute 聚焦于 全模态社交视频理解,尤其擅长处理需要跨模态协调与时间推理的场景。典型的工业落地方向包括:
- 视频会议/远程协作平台:自动分析参会者的手势、语气、话语与表情是否一致,生成会议要点或协作建议,提升异步沟通效率。
- 电商直播:实时审核主播的宣传内容,验证口头描述是否与展示商品一致(如材质、颜色、功能),自动标记风险片段;同时评估主播的社交互动质量,辅助流量分配。
- 内容平台:对短视频、Vlog 进行深度语义标注,理解叙事中的讽刺、情绪转折等,改善推荐系统的多模态召回与排序。
商业价值
该技术直接冲击 降本 与 体验提升 两条线。在内容审核场景中,人工复审率可下降 30% 以上,尤其对需要跨模态交叉验证的复杂案例(如假新闻视频、虚假宣传)能大幅减少人工介入。在用户侧,更精准的多模态理解可驱动推荐系统 CTR 提升 2–5 个百分点,并支撑新的交互功能(如视频问答、智能剪辑)。由于其路由机制能根据推理需求动态选择专家,推理成本可控,适合大规模部署。
与现有产品/工作流的接口
CogniRoute 可封装为 多模态推理微服务,与现有视频处理 Pipeline 集成。典型接口:
- 输入对齐:接受
(video clip, audio, transcript)三元组,与平台已有的特征提取模块(如 Whisper 语音转写、CLIP 视觉编码)对接。 - 路由层:训练好的认知模式可固化为一组 路由签名,部署时仅需轻量路由网络,无需额外推理计算。
- 输出格式:生成答案 + 证据片段(时间戳、模态来源),可与下游业务(审核规则引擎、推荐特征存储)直接交互。
具体用例
- 在线教育:集成到授课系统,分析学生视频中的表情、语音反馈与互动文本,实时评估参与度与困惑点,触发教师干预。OmniSocialBench 中关于时间定位和矛盾检测的能力可迁移至此。
- 智能座舱:理解驾驶员或乘客的多模态指令(语音 + 手势 + 视线),在车载语音助手基础上提升复杂指令(如“打开那边那个窗户”)的解析成功率,减少歧义。
局限
- - **认知模式依赖人工定义,泛化性受限**:论文中的认知模式将每个样本按跨模态关系、推理需求和时间范围进行因子化,这些模式是预先设定的,覆盖范围有限,对于超出预定义类别的复杂社交场景可能难以适配。实际应用中,面对新任务或新领域,需重新设计schema,带来额外的人力成本和专家知识依赖。
- - **仅在自建基准 OmniSocialBench 上验证,外部泛化未知**:论文构建了专门的社会视频问答数据集,并以此评估方法性能,但未在已有的通用全模态推理基准(如 ActivityNet-QA 等)上进行测试。59.38% 的绝对准确率虽领先基线,但距离实用仍有差距,且缺少跨数据集实验,方法的跨域迁移性和鲁棒性存疑。
- - **强化学习训练复杂,可能破坏已有对齐**:路线感知强化学习引入答案正确性、模态一致性推理和认知时间基础三个奖励项,奖励权重调整敏感,训练不稳定风险较高。全局路由签名的对齐仅在监督微调阶段完成,强化学习阶段可能远离对齐点,导致路由退化。此外,多专家推理结构带来额外计算开销,影响实时应用部署。