训练智能体与其 Harness 共同进化:TaoLive Digital Avatar Agent 技术报告
AI 驱动的数字人主播必须在实时场景中回答商品问题、吸引观众并执行营销策略,这要求低延迟、频繁的策略更新以及准确而有效的响应。可演化 Harness(Evolvable Harnesses)允许 Skills、Hooks、提示词和工具独立于模型权重进行更新,从而实现快速迭代,但这也带来权衡:大模型虽能零样本适应却速度太慢,紧凑模型虽满足延迟要求却容易过拟合固定的 Harness 配置。 为此,我们提出 Harness-Aware Training (HAT),训练紧凑模型适应不断变化的 Harness。其关键组件 Harness-State Augmentation (HSA) 对 Skill 标识符与内容、工具模式、提示结构和 Hook 函数施加保留任务的变换。训练分三个阶段进行:HSA-SFT 从强模型轨迹中学习推理与工具使用;General On-Policy Distillation 恢复 SFT 期间丢失的泛化能力;HSA-RL 通过增强环境中的强化学习提升对 Harness 变化的鲁棒性。 在四个评测集上,HAT 在 Live-Stream QA 上达到 94.8(基线 80.3;最强通用 LLM 93.0),在 Harness-Variant QA 上达到 94.6(基线 75.4)。与固定 Harness 的 SFT 相比(后者使 IFEval 较基础模型下降 7.7 分),HAT 避免了该回退并达到 83.5。在单块 NVIDIA H20 GPU 上,优化系统的 P50 和 P95 延迟分别为 3.4 秒和 8.1 秒。该系统已部署于淘宝直播的数字人服务,并在 GMV 和商品页浏览量上取得了正向的在线 A/B 测试结果。
论文精读
TL;DR Harness-Aware Training 利用 Harness-State Augmentation 让紧凑模型在训练中适应多种 Harness 配置,实现低延迟下动态进化,直播问答达 94.8 分,超越最强通用 LLM。
问题
问题背景
直播电商数字人需实时回答商品问题、与观众互动并执行营销策略,模型必须同时满足低延迟、高准确与策略快速迭代。业界正探索将 Skills / Hooks / prompts / tools 封装成可独立更新的 Harness,使系统无需重训模型即可调整行为。
现有方法局限
- 大模型:具备零样本适应新 Harness 的泛化能力,但推理延迟过高,无法满足实时直播交互。
- 紧凑模型:延迟达标,但通常在固定 Harness 配置上训练,对特定 Skill 标识符、工具 schema、提示模板 过拟合;一旦 Harness 更新,模型表现显著下降,需要频繁重训。
- 二者之间存在根本权衡:零样本适应能力与低延迟不可兼得,固定 Harness 的 SFT 还会损害通用指令遵循能力(如 IFEval 下降 7.7 分)。
为什么这个问题难/重要
- 动态环境:Harness 演化要求模型理解“当前配置”而非记忆特定版本,但紧凑模型容量有限,难以从有限训练分布泛化到未见组合。
- 任务耦合:直播场景同时涉及问答、工具调用、多轮交互与策略执行,任何 Harness 微调都可能影响其他能力,形成负迁移。
- 工程价值:如能训练出“与 Harness 协同进化”的紧凑模型,可避免每次策略迭代都进行昂贵重训,同时保持在线服务延迟,对实时 AI 智能体部署极具吸引力。
行业类比
类似于可插拔插件架构的智能客服系统:底层语言模型不应因新增一个工具或修改一段提示词就需要重新预训练,而是应该像操作系统加载驱动一样,动态适配新插件并保持响应速度。
核心洞察
- Harness-State Augmentation 将动态环境配置本身转化为可学习的输入表征。传统 agent 训练通常固定 Harness,模型记忆特定 Skills/Hooks 映射,一旦配置更新就失效;HSA 通过任务保持变换(改变标识符、工具 schema、prompt 结构、Hook 实现)迫使模型理解 Harness 的语义内容而非表面形式,从而在推理时对新配置具备零样本泛化能力。与单纯增加环境多样性的 domain randomization 不同,HSA 变换保证任务语义不变,避免引入无关噪声。
- General On-Policy Distillation 阶段专门修复 SFT 造成的通用能力衰退。常见 RLHF/SFT 流程在 agent 任务上微调后,通用指令遵循基准(如 IFEval)会大幅下降,文中 Fixed-Harness SFT 比基座模型降低 7.7 分;HAT 通过从强模型采样 on-policy 轨迹进行蒸馏,恢复紧凑模型的通用行为,最终达到 IFEval 83.5,同时保持任务性能。这提示 agent 训练不能只看任务指标,需要显性维护基础能力,否则会牺牲模型的通用价值。
- 紧凑模型结合 Evolvable Harness 可以替代大模型的零样本适应,实现低延迟与高可迭代性共存。部署结果显示在同一 NVIDIA H20 GPU 上 P95 延迟 8.1s,且 Live-Stream QA 分数 94.8 超过最强通用 LLM 的 93.0,同时 Harness 可独立更新免重训。这打破了“低延迟必须牺牲动态适应”的惯性假设,为实时交互式 AI 系统提供了兼顾工程效率与模型性能的训练范式。
方法
方法概览
Harness-Aware Training (HAT) 旨在训练紧凑模型在推理时理解并适应当前 Harness(包含 Skills、Hooks、提示词与工具配置),而非记忆固定版本。
输入:动态演化的 Harness 状态,包括技能标识符与内容、工具 schema、提示结构、Hook 函数。训练时通过 Harness-State Augmentation (HSA) 对这些组件施加任务保持变换,例如重命名技能 ID、调整工具参数描述、改变提示模板顺序、替换 Hook 实现等,生成多样化的伪环境。
关键模块与流程:
- HSA-SFT:从强模型轨迹中蒸馏推理与工具调用能力,训练样本的 Harness 状态经过 HSA 变换,使模型学习将 Harness 状态作为条件信息,而非依赖固定配置。
- General On-Policy Distillation (General OPD):针对 SFT 后的泛化损失,用通用领域数据在策略上蒸馏,恢复基础能力,避免 IFEval 等指标下降。
- HSA-RL:在增强环境中进行强化学习,奖励兼顾任务完成与对 Harness 变体的鲁棒性,进一步强化模型在新 Harness 编辑下的表现。
输出:一个紧凑、低延迟的直播数字人代理,能实时解析当前 Harness 并生成准确回复。部署在 NVIDIA H20 上 P50/P95 延迟为 3.4s/8.1s,在 Live-Stream QA 达 94.8、Harness-Variant QA 达 94.6。
与同类方法差异:不同于 Fixed-Harness SFT 导致模型过拟合固定配置并损害通用能力(IFEval 下降 7.7),HAT 通过 HSA 注入 Harness 状态多样性,使紧凑模型具备类似大模型的零样本适应能力,同时保持低延迟。
实验
实验设计
HAT 采用三阶段训练:HSA-SFT 学习多环境强模型轨迹,General On-Policy Distillation 恢复通用能力,HSA-RL 在增强环境做强化学习。评估覆盖 Live-Stream QA、Harness-Variant QA、IFEval 及部署推理、Held-Out Harness 编辑、人类盲测、在线 A/B 测试。
关键发现
- HAT 将 Live-Stream QA 从 base 的 80.3 提升至 94.8,超过最强通用 LLM 的 93.0;Harness-Variant QA 从 75.4 提升至 94.6。
- 避免 IFEval 回归:HAT 达 83.5,而 Fixed-Harness SFT 比 base 下降 7.7 分。
- 单 H20 GPU 上 P50/P95 延迟为 3.4s/8.1s,满足实时交互。
与基线对比解读
不同于 Fixed-Harness SFT 过拟合固定配置,HAT 通过 Harness-State Augmentation 让模型学会“读取”当前 Harness 而非记忆版本,因此在 Harness 变异测试中表现稳健且保留通用指令跟随。对比大型通用 LLM,HAT 在准确率上接近或超越,同时延迟低一个量级,证明紧凑模型经 Harness-Aware 训练可同时满足适应性与实时性,为生产环境频繁更新策略提供了可行路径。
行业影响
落地场景
HAT 适用于实时交互型 AI Agent,特别是直播电商数字人:在 Taobao Live 已部署,处理商品问答、观众互动、营销策略执行。此外,内容平台虚拟主播、企业级智能客服、教育虚拟讲师等需要低延迟且频繁更新业务流程的场景同样适用。核心条件是:业务策略(Skills/Hooks/prompts)高速迭代,而模型权重无法频繁重训。
商业价值
- 降本:用紧凑模型替代大模型,大幅降低推理算力与延迟;HAT 避免每次 Harness 更新都重训模型,省去持续训练成本。
- 增收:在线 A/B 测试显示 GMV 与商品页浏览量正向提升,说明交互质量直接驱动转化。
- 体验提升:P50 3.4s / P95 8.1s 的低延迟满足实时对话,Harness-Variant QA 94.6 表明模型能适应策略变化而不掉点。
与现有工作流集成
HAT 与Harness 架构天然兼容,训练得到的紧凑模型可作为即插即用的替换件,无需改动运行时(Skills/Hooks/prompts/tools 调用协议不变)。集成路径:
- 保留现有 Harness 定义,将模型替换为 HAT 训练版本。
- 用 HSA 对训练数据做任务保持变换,生成覆盖不同 Harness 状态的样本。
- 沿用现有 agent 编排框架(如 SGLang MTP 部署),直接上线。
关键差异:相比 Fixed-Harness SFT 导致 IFEval 下降 7.7 分,HAT 保持通用能力同时提升 Harness 泛化,避免“策略一变模型就退化”的陷阱。
局限
- **训练成本与管线复杂度高**:HAT 三阶段管线依赖强模型生成高质量轨迹(HSA-SFT),并需要构建大规模模拟环境执行 General OPD 与 HSA-RL。论文未披露具体算力开销与训练时长,但 RL 阶段通常需要大量采样与迭代,对中小团队不友好。此外,HSA 变换空间有限:论文只列举了 Skill 标识符、内容、tool schema、prompt 结构、Hook 函数等维度,实际 Harness 演化可能涉及更复杂的逻辑变更(如全新 Skill 类型、跨模块交互),有限的变换无法完全模拟真实世界中的任意修改,长期部署仍可能出现分布漂移,需要持续监控与周期性重训。
- **评估场景单一,泛化性存疑**:所有离线评估集与在线 A/B 测试均围绕直播电商数字人场景,尤其是产品问答、观众互动与营销策略执行。虽然 Harness-Variant QA 测试了不同 Harness 配置,但仅限于同一业务领域内的变化。对于其他高动态 Harness 场景(如在线教育、医疗咨询、金融客服),任务语义、工具接口、用户意图分布差异极大,HAT 依赖的模拟环境与 HSA 变换可能不适用。论文未提供跨领域迁移实验,也未讨论训练数据与 Harness 演化的领域敏感性,导致方法的泛化边界不清晰。
- **与大型模型零样本适应仍有差距**:尽管 HAT 在 IFEval 上避免了回归(83.5),表明通用能力保持较好,但其泛化机制仍是“见过更多变体”而非真正的元学习。当遇到训练中未覆盖的全新 Harness 配置时,紧凑模型仍可能表现下降;相比之下,大型模型可以凭借常识与指令跟随能力零样本理解新 Harness,只是延迟过高。HAT 只能提供“有限演化能力”,无法完全替代大型模型的鲁棒性。此外,论文未开源代码与数据集,仅提供技术报告,阻碍了第三方复现与对比,降低了方法的可信度与影响力。