论文

Exploring Collaboration between a Language and a Non-Language Agent

Exploring Collaboration between a Language and a Non-Language Agent

大语言模型(LLM)越来越多地被部署为编排器,通过自然语言协调专门化的子代理来解决复杂任务。然而,在游戏、机器人等多个重要领域中,最强的可用代理并非语言模型。将非语言代理与 LLM 整合需要言语化(verbalization):即在每个交互步骤中,将其丰富的连续表征压缩为稀疏的文本摘要。为探究言语化是否构成瓶颈,本文引入 LLAMIA-Bench,一个包含六项多样协作国际象棋任务的基准套件,覆盖三个层面:行为模仿、状态评估和自然语言解释。每项任务实例化一个公认的、LLM 和棋弈引擎单独都无法解决的难题。 为解决 LLM 与非语言代理的协作,本文提出 潜在状态内化(latent state internalization),该方法将子代理的连续表征直接作为学习状态令牌(learned state tokens)投射到 LLM 的令牌流中,并在动作推进环境状态时进行动态重新编码(dynamic re-encoding)。将内化方法与言语化集成对比,实验揭示了一致的言语化负债(verbalization debt):性能差距随训练进程扩大,并在 LLM 规模从 4B 扩展到 14B 参数时依然存在。 采用潜在状态内化训练的单一 14B 模型 LLAMIA,在全部基准任务上匹配或超越任务专用专家及包括带工具访问的 GPT-5.1 在内的前沿模型,并在任务特定微调失效的分布外场景中具备泛化能力。

论文精读

TL;DR LLAMIA-Bench 证明将非语言 agent 的连续状态直接嵌入 LLM token 流可绕过文本摘要瓶颈,训练出的 14B 模型在六项棋类协作任务上超越 GPT-5.1 等前沿模型。

问题

问题背景

LLM 正越来越多地被用作 orchestrator,协调多个专用子智能体通过自然语言完成复杂任务。但在游戏博弈、机器人控制等领域,最强的可用智能体往往不是语言模型,而是依赖连续状态表示和搜索的专用系统,如国际象棋引擎 Lc0。

现有方法局限

集成非语言智能体的常规做法是 verbalization:在每一步交互中,将子智能体的丰富连续表示压缩为稀疏文本摘要。这一过程带来三个具体限制:

  1. 信息损失:连续高维向量(如棋盘评估、策略分布)难以用有限词元精确表达,数值与概率信号在离散化后严重失真。
  2. 上下文开销:逐阶段生成文本摘要消耗 LLM 上下文窗口,且文本长度与信息密度不成比例。
  3. 训练退化:实验显示,随着训练推进,verbalized 集成出现 verbalization debt——性能差距持续扩大,且模型从 4B 扩展至 14B 后依然存在,说明该瓶颈无法通过简单扩展 LLM 解决。

为什么这个问题难/重要

难点在于非语言智能体的内部状态通常是高维连续向量,与 LLM 的离散 token 空间存在结构性差异。直接映射需要学习跨模态投影,并保持时序一致性:当环境状态被动作推进时,状态 token 必须动态更新。业界对多智能体编排、工具调用和跨模态融合高度关注,解决该问题可让 LLM 充分利用现有最优专用智能体,避免重新训练语言模型去模仿非语言技能,同时省去文本 verbalization 的额外生成成本。

行业类比

类似视觉问答中,先把图像转成自然语言描述再让语言模型回答,准确率显著低于直接输入图像特征向量;或自动驾驶中将激光雷达点云摘要为文字后交给规划模型,会损失关键感知信息。本工作相当于为 LLM 打开一条直接读取子智能体内部状态的“感知通路”。

核心洞察

  • **Verbalization debt** 是将非语言代理的连续状态压缩为文本摘要所累积的不可逆信息损失,且该损失随训练步数和模型规模增加而持续扩大。主流 LLM 工具调用范式默认文本描述足够传递状态,但本工作通过 LLAMIA-Bench 的六个协作象棋任务证明,文本瓶颈导致性能差距在训练后期放大,即使 GPT-5.1 with tool access 也无法弥补,这提示多智能体编排中语言接口并非无损中介。
  • **Latent state internalization** 通过将非语言代理的连续表示直接投影为 LLM 的 learned state tokens,并随环境动态重新编码,使 LLM 无需文本中介即可感知高维状态。与 PaLM-E 风格的单次视觉注入或手工模板相比,该方法不仅匹配任务专家和 frontier 模型,还在 OOD 行为克隆中保持泛化,而任务专用微调则崩溃,说明感知级表征融合比语义级描述更具可扩展性和鲁棒性。

方法

输入与目标

LLM 作为 orchestrator 需要协调非语言子代理(如国际象棋引擎 Lc0)完成协作任务。子代理拥有丰富的连续状态表示(如棋盘评估、策略向量),但 LLM 只能处理 token 序列。传统方案是 verbalization:将连续状态压缩为文本摘要,但这会引入 verbalization debt。

核心模块:LatentBridge 与 learned state tokens

方法引入 latent state internalization:训练一个 LatentBridge projector,将子代理的连续表示投影为固定数量的 learned state tokens(例如 4 个),这些 token 直接插入 LLM 的输入 token 流中,占据特殊位置。随着环境动作推进,子代理状态更新,投影器会 dynamic re-encoding,生成新的 state tokens 反映最新状态。

  • 投影器架构:小型 MLP 或 attention 层,将子代理的隐藏层输出映射到 LLM 的嵌入维度。
  • Token 插入位置:在指令 token 之后、文本上下文之前,或作为特殊分隔符。

训练流程

  1. Stage 1: Projector Alignment:冻结 LLM 和子代理,仅训练 LatentBridge,使 state tokens 能重建子代理的关键状态信息(自监督或蒸馏目标)。
  2. Stage 2: Reinforcement Learning:使用 DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)对全系统进行端到端微调,优化协作任务奖励(如棋局胜负、注释准确性)。

输出

LLM 基于指令和 state tokens 生成决策(如走子、评估、自然语言解释),直接输出 token 序列。

与同类方法的差异

与 verbalized integration(文本摘要注入)和 PaLM-E-style injection(视觉-语言对齐)不同,internalization 不经过显式语义压缩,而是让 LLM 通过梯度学习直接从连续状态中提取协作所需信息,从而避免 verbalization debt。

实验

实验设计

基准 LLAMIA-Bench 包含六个协作象棋任务,覆盖行为模仿、状态评估与自然语言解释三类能力。对比两条技术路线:

  • Verbalized integration (LLAMIA-Verb):将非语言象棋引擎 Lc0 的连续状态压缩为文本摘要,再输入 LLM。
  • Latent state internalization (LLAMIA):通过 LatentBridge 把 Lc0 的内部表征投影为 learned state tokens,直接插入 LLM token 流,并在每个动作后动态重编码。

训练分两阶段:Stage 1 Projector Alignment(对齐投影器)与 Stage 2 Reinforcement Learning(采用 DAPO)。模型规模为 4B、8B、14B,与任务专家及 GPT-5.1 with tool access 等前沿基线对比。

关键发现

  • 存在一致的 verbalization debt:内部化与文本化集成之间的性能差距随训练扩大,且从 4B 到 14B 持续存在。
  • 单个 14B LLAMIA 在所有基准任务上匹配或超过任务专家与 GPT-5.1 with tool access,并在分布外(OOD)场景中表现出泛化能力,而任务定制微调模型则崩溃。
  • 消融表明,提升来自 Lc0 的潜在状态而非额外参数;内部化策略使推理成本与文本化基本持平。

与基线的深度对比

相对于 LLAMIA-Verb,内部化绕过了文本压缩导致的信息损失,保留了连续表征的丰富性,使 LLM 能进行更精细的协同决策。与 任务专家 相比,LLAMIA 不是单纯模仿,而是学会在 LLM 与引擎间构建 任务特定的协作策略;面对未见过的棋盘局面,其 OOD 泛化能力显著优于为特定任务微调的模型,证明学到的是可迁移的协作范式而非记忆。这一思路对 AI 工程实践启示明显:在机器人控制、游戏 AI 等需要非语言代理的场景中,将连续状态直接注入 LLM token 流,可能是比强制 verbalization 更高效的集成路径。

行业影响

落地场景

  • 多智能体编排系统中,LLM 作为 orchestrator 协调非语言专家模型(棋类引擎、物理仿真器、推荐系统、交易策略模型等)。LLAMIA 方案可应用于:
    • 电商智能导购:LLM 需实时读取推荐系统或供应链优化器的连续状态,直接注入 latent tokens,避免文本摘要丢失细粒度信号,提升推荐准确率与转化率。
    • 自动驾驶决策:LLM 协调运动规划器,将规划器内部表示映射为 latent tokens,用于高阶决策与自然语言解释,解决纯文本接口延迟高、信息损失大的问题。

商业价值

  • 降本:latent state internalization 省去中间文本化与 token 生成,减少推理延迟和计算开销;14B 模型即可达到大模型与专家系统水平,降低部署成本。
  • 增收与体验提升:在复杂决策任务(个性化推荐、实时交易、机器人交互)中,精度与泛化能力提升可直接影响转化率、用户留存和服务质量。

与现有产品/工作流的接口

  • 无需替换现有非语言专家系统,只需增加 LatentBridge projector 将其内部状态映射为 learned latent tokens,注入 LLM token stream;训练分两阶段:projector alignment + RL(如 DAPO)。
  • 接口类似多模态 LLM 的 adapter,可作为 plugin 或 tool 集成进 LangGraph、AutoGen 等 agent 框架;推理成本与直接 verbalization 接近,工程落地可行性高。
  • 实施注意:latent tokens 需与任务对齐,训练数据需覆盖 OOD 分布;建议先在小规模任务验证再拓展。

局限

  • 基准领域单一:LLAMIA-Bench 完全基于国际象棋,尽管包含六种任务,但环境特性(离散状态、明确规则、强大专家引擎 Lc0)可能不具代表性。虽然附录报告了围棋实验,但主评估和结论主要来自象棋,对机器人等连续控制、部分可观测环境的适用性未得到充分验证。这限制了方法泛化能力的说服力,读者需要谨慎外推到更复杂的非语言 agent 场景。
  • 方法依赖子 agent 的可访问连续表示:latent state internalization 要求非语言 agent 提供其连续状态向量(如 Lc0 的神经网络激活),但在许多实际系统中,子 agent 可能是黑盒 API、专有模型或仅提供文本输出,无法获取内部表示。这使得方法无法直接应用于所有 LLM 编排场景,而 verbalization 是更通用的接口。论文未讨论如何处理此类不可访问情况,也未提出替代方案。
  • 训练成本与可扩展性:方法需要两阶段训练(projector alignment + RL),且在大规模骨干(14B)和多个任务上训练,根据附录 A.1,训练 GPU-hours 较高。论文仅测试到 14B 参数,对于更大模型(如 70B 或以上)是否继续有效、训练成本是否可承受,以及 projector 能否随模型规模线性扩展,均未验证。这影响其在资源受限环境中的实用性,也留下了可扩展性方面的疑问。
论文Harini S I2026-09-02原文

相关内容