论文

Omni Interaction Agent 技术报告

Omni Interaction Agent 技术报告

本文提出 Gander,一个在单一框架内统一全模态感知、实时交互与智能体能力的端到端模型。 与传统的轮次式范式不同,Gander 持续接收视频、语音、文本等多种模态的流式输入,在日常对话与复杂工作流导向的智能体场景中实现自然的全双工交互:用户可随时打断模型,模型也能主动给出中间反馈或提出追问。 为原生支持上述能力,Gander 采用两项关键架构设计: 1. Cerebellum-Brain 协同框架:Cerebellum 负责实时交互与全模态对话能力,Brain 负责复杂推理与更高层的智能体任务,二者通过 tool calling 与 agent orchestration runtime 持续交互; 2. Cerebellum 基于流式 Thinker-Talker 架构,用户输入与模型输出在 chunk 层面被展平为有序 token stream,为低延迟的持续交互提供统一表示。 实验方面,我们从对话能力、全模态理解、交互能力与智能体智能四个维度对 Gander 进行全面评测。内部人工评测表明,Gander 在保持 SOTA 开源模型自然、富有表现力的口语对话能力的同时,在全模态交互上取得有竞争力的表现,并在背景噪声干扰、多方交互与 backchannel 沟通等挑战性真实场景中展现出鲁棒性。我们开源发布 Gander 及其模型、代码与数据,以促进社区的进一步研究与开发。

论文精读

TL;DR Gander 是统一视听文全模态感知、实时全双工交互与智能体能力的端到端框架,通过 Cerebellum-Brain 协作与流式 Thinker-Talker 架构,实现可打断、可主动反馈的连续交互。

问题

问题背景

当前 AI 领域正从 单模态、turn-based 对话转向 全模态、实时、全双工 交互,同时融入智能体复杂任务执行能力。

现有方法局限

  • 传统语音助手 基于 turn-taking 流水线(ASR→LLM→TTS),无法自然处理用户打断、实时反馈与多模态上下文;时延高,且各模块独立优化,缺乏统一表示。
  • 现有端到端语音模型 虽实现语音到语音,但多仅处理音频,缺乏视频等全模态感知;推理与交互耦合,难以支持复杂 agent 工作流(如多步工具调用)中的持续交互。
  • 多模态大模型 可理解图像/视频,但多为非流式、异步处理,无法满足实时全双工交互的低延迟需求。

为什么这个问题难/重要

  • 技术挑战:多模态流式输入需在 chunk 级对齐,同时保持低延迟响应;模型需在推理(Thinker)与生成(Talker)之间高效调度,支持用户随时打断和模型主动提问。
  • 业界关注度:实时多模态交互代理是下一代 AI 助理的核心方向,涉及语音助手、具身智能、远程协作等场景;开源社区缺乏真正统一感知、交互与智能体的端到端框架。

行业类比

类似于 自动驾驶系统 中从感知、规划到控制的实时一体化设计,Gander 试图将多模态感知、实时对话与 agent 决策统一到单一框架,避免传统模块化方案的信息延迟与错误累积。

核心洞察

  • Gander 的核心创新之一是将实时交互与复杂推理解耦为 Cerebellum 和 Brain 两个协作组件。Cerebellum 负责流式处理视频、语音、文本,维持全双工对话并允许随时打断;Brain 仅在需要时通过工具调用介入进行高层次的 agent 规划与推理。这种设计与以往单一模型同时承担所有功能不同,它避免了低延迟要求和高计算负载之间的冲突。对工程实践而言,这提示在构建语音 agent 时可将高频交互路径与低频推理路径分离,通过编排运行时协调,从而在保证响应速度的同时不牺牲 agent 能力。
  • Gander 将多模态输入和输出统一为 chunk 级别的有序 token 流,这一表示方式是实现自然全双工交互的关键。与传统的 turn-based 系统或依赖状态机的全双工方案不同,打断、主动插话、backchannel 等行为都可以在同一个序列框架内自然建模,无需额外规则处理。这种扁平化设计让模型能持续地、低延迟地感知和生成,并简化了在线训练与推理的工程实现。对于实时多模态系统开发者,采用统一的 token 流表示可以减少模块间接口复杂度,提升鲁棒性。
  • 论文中显式构建了包含背景噪声、多方交互、backchannel 通信的鲁棒性和负样本数据,这是 Gander 在真实场景中表现稳定的重要原因。大多语音交互数据集偏向干净、单人、轮流发言,模型容易在部署时失效。Gander 的数据管线覆盖这些非理想条件,使模型学会处理干扰和重叠语音。这一做法对工程有直接借鉴意义:构建实时交互 agent 时,应有意识地注入真实世界噪声和边缘交互模式,而不是仅依赖标准数据集。

方法

输入与整体架构

Gander 接收连续多模态流式输入,包括视频、语音与文本,支持全双工交互,用户可随时打断,模型也可主动反馈或追问。

关键模块

  1. Cerebellum-Brain 协同框架:

    • Cerebellum 负责实时交互与全模态对话(omni conversational capabilities)。
    • Brain 处理复杂推理与高层代理任务(agentic tasks)。
    • 两者通过工具调用(tool calling)和代理编排运行时(agent orchestration runtime)持续交换信息。
  2. Streaming Thinker-Talker 架构:

    • 将用户输入与模型输出在 chunk 级别展平为有序 token 流(ordered token stream),统一表示低延迟连续交互。
    • Thinker 模块负责多模态感知(视觉感知、声学感知),Talker 模块负责语音生成(语音 token 生成 + 波形合成)。

输出与协作

Cerebellum 输出自然对话、中间反馈或工具调用请求;Brain 输出推理结果或执行复杂代理工作流。整体实现端到端的实时交互与代理能力统一。

与同类方法差异:传统语音代理多为回合制(turn-based)范式,Gander 通过 chunk 级 token 流和 Cerebellum-Brain 分离设计,原生支持持续流式全双工交互与代理任务协同。

实验

实验设计

针对 Gander 的全双工交互核心能力,论文从四个维度构建评估体系:口语对话能力、全模态理解、交互实时性 与 智能体推理。评估采用内部人工评测,对比对象为 SOTA 开源模型(如语音语言模型基线)。评测场景涵盖日常闲聊与工作流导向的复杂任务,并额外加入 背景噪声、多方对话、回程信号(backchannel) 等鲁棒性测试。

关键发现

Gander 在保持口语自然度和表现力方面达到 SOTA 开源模型水平,同时在实时交互能力上表现竞争性。模型支持用户任意时刻打断,并能主动提供中间反馈或追问,验证了 Cerebellum-Brain 架构在持续 token 流下的低延迟特性。在含噪声、多人对话和 backchannel 的挑战场景中,模型表现出较强鲁棒性。

基线对比解读

与 turn-based 传统范式相比,Gander 的 streaming chunk flattening 将输入输出统一为有序 token 块,显著降低交互延迟;与现有开源全双工语音模型相比,Gander 额外集成了 agentic 能力,通过工具调用与编排运行时,在任务型对话中优势明显。但论文未披露公开基准的量化指标,内部人类评估的透明性、可复现性有待提升。

行业影响

落地场景

Gander 的流式多模态实时交互能力可直接嵌入以下产品形态:

  • 实时 AI 客服 / 销售助手:在电话或视频客服中实现全双工对话,模型可主动追问、即时反馈,减少用户等待与工单升级。
  • 协作式 Agent 工作台:面向研发、设计、数据分析等场景,用户用语音+屏幕共享与 Agent 持续交互,Agent 在推理过程中主动汇报进度或请求澄清。
  • 智能硬件与陪伴机器人:模型支持视频+语音输入,可在嘈杂环境中进行多人对话与 backchannel(如点头、嗯声),适合实时陪伴或导览设备。

商业价值

  • 降本:端到端统一模型减少多模块拼接(ASR/NLU/TTS)的工程维护与推理延迟,从而降低实时交互服务的计算成本。
  • 增收:全双工交互提升转化率,例如电商导购中用户可随时打断并追问商品细节,模型及时响应减少流失。
  • 体验提升:流式 Thinker-Talker 架构使首字延迟降低,用户感知更接近真人对话;Cerebellum-Brain 分工让日常寒暄保持轻量,复杂任务才调用大模型推理,平衡响应速度与深度。

与现有产品/工作流的接口

  • 集成方式:作为独立服务或库部署,暴露 gRPC/WebSocket 接口,接收音频流、视频帧、文本事件,输出 token 流与工具调用事件。
  • 工具编排:Agent Orchestration Runtime 与现有 MCP/插件生态对接,Brain 通过 tool calling 触发外部 API,企业可将 CRM、订单系统、知识库注册为工具。
  • 渐进替换:初期可作为现有语音助手的“实时交互层”,保留原有后台业务逻辑,后续逐步将复杂 agentic 任务迁移到 Brain 模块。

具体落地 use case:

  1. 电商直播助播:品牌直播间部署 Gander 作为实时助播,观看用户可语音打断提问,模型结合商品视频流与评论区文字,即时回答材质、尺码、优惠等,并主动追问“需要我帮您对比两款型号吗?”,提升互动与下单转化。
  2. 远程医疗预问诊:患者在候诊室通过平板发起视频对话,Gander 持续收集主诉、既往史,并可根据摄像头画面提醒患者调整角度展示皮损,同时生成结构化病历草稿,供医生快速接诊。

局限

  • **评估基准单一**:论文主要依赖内部人类评估来验证 Gander 在对话能力、全模态理解、交互能力和 agentic 智能上的表现,但未提供与现有 SOTA 开源模型(如 Moshi、Qwen2.5-Omni、MiniCPM-o 等)在公开基准上的系统定量对比。这导致外部研究者难以直接判断其相对优势,也降低了结果的可复现性。内部评估可能受主观偏差影响,且未公开样本量、评估者间一致性等细节。建议后续补充声学、语义、交互流畅度等客观指标,并在通用 omni benchmark 上进行标准化测试。
  • **Cerebellum-Brain 分离的工程复杂度与潜在瓶颈**:Cerebellum 负责实时交互,Brain 处理复杂推理和 agentic 任务,二者通过工具调用和编排运行时持续通信。但 Brain 通常依赖外部 LLM(可能为闭源或特定版本),训练免的设计虽然灵活,却可能引入额外网络延迟、上下文切换开销以及不可控性。论文未报告端到端延迟的定量数据(如 P50/P95 响应时间、工具调用往返时间),也未评估高频中断或复杂工作流下系统级性能。此外,外部 LLM 的能力上限会直接制约整体 agentic 智能,且涉及用户数据的隐私与安全风险未被充分讨论。
  • **数据质量与泛化性待验证**:数据构建管道包含 Speech Interaction、Audio-Visual Interaction、Agentic Interaction 及鲁棒性负样本等多种合成数据,但论文未披露数据规模、领域配比、去重策略和质量控制细节。合成数据可能存在分布偏移或语言单一性,导致模型在真实世界多语言、多口音、强背景噪声、多人重叠语音等场景下的泛化能力不足。虽声称鲁棒性,但实验仅在有限场景下验证,未见大规模真实用户评测或在线 A/B 测试。此外,全双工交互中的打断成功率、主动反馈恰当率、backchannel 自然度等关键行为尚未通过定量指标评估,行为真实性有待进一步检验。
论文Orantqing2026-09-08原文

相关内容