论文

onPanda:通过 Token 级修正高效标注 LLMs 与 Agents 的 On-Policy 对齐数据

onPanda:通过 Token 级修正高效标注 LLMs 与 Agents 的 On-Policy 对齐数据

onPanda 是一款用于高效标注 LLM 对齐数据与 Agent 轨迹的交互式工具,其核心交互方式是 token 级修正(token-level correction)。 标注者在阅读模型回复时,定位第一个不合适的 token,随后从模型的候选 token 中挑选替代项,或通过自由编辑直接输入正确文本。系统随即截断该位置之后的所有内容,并从修正后的前缀继续生成,如此循环执行“定位—修正—续写”,直至得到满意的回复。该机制让标注者能以低成本精确引导模型输出:一项小规模对照研究显示,onPanda 相比人工后编辑可将标注耗时中位数降低 52%。 由于最终回复中绝大多数 token 仍由模型自身生成,所得数据在很大程度上保留了模型的采样分布,非常适合构建 on-policy SFT 与偏好数据。此外,标注过程中记录的 token 级修正提供了位置精确的细粒度监督,并天然构成正负样本对。onPanda 还可连接外部工具与 harness,支持在真实环境中进行交互式轨迹标注。 同时,我们发布了使用 onPanda 标注的数据集 Panda-CVL,以及一个面向 token 级修正的 benchmark。

论文精读

TL;DR onPanda 提供 token 级纠错交互:标注者定位首个错误 token 并替换后,模型从该前缀继续生成,循环直至满意。相比手工后编辑减少 52% 中位标注时间,且保留模型采样分布,适合构造 on-policy 对齐数据。

问题

问题背景:当前 LLM 对齐领域高度关注 on-policy 数据 的质量与获取成本,期望在保持模型自身采样分布的前提下规模化生产监督信号。

现有方法局限:传统 事后编辑 (post-editing)需要标注者逐段重写模型输出,不仅耗时,且大量人工改写会破坏原始采样分布,导致后期 SFT 数据偏离 on-policy;偏好标注 只提供整体比较信号,缺少精确 token 位置,难以定位具体错误;现有 agent 轨迹标注工具多依赖人工逐步骤修改,无法利用模型候选 token 进行快速迭代修正,交互效率低。

为什么这个问题难/重要:构建高质量对齐数据需要在标注效率、监督细粒度与分布保持之间取得平衡。token 级修正能同时提供位置精确的监督和自然配对的正负样本,但实现“定位—修正—继续生成”的闭环需要工具支持,且要求低延迟、可扩展。业界在 RLHF / DPO / 在线学习等流程中,对低成本获取细粒度 on-policy 数据的需求持续上升。

行业类比:类似自动驾驶远程接管中对规划轨迹进行 关键航点修正 ,而不是从头重新规划整条路径,从而保留大部分自动决策并精准干预故障片段。

核心洞察

  • 交互式 token 级修正与继续生成机制,在降低标注成本的同时保留模型 on-policy 分布。传统人工后期编辑常完全重写或大幅修改,导致最终文本偏离模型原始采样,难以用于针对性对齐;而 onPanda 只让标注者替换第一个出错 token,之后由模型继续生成,故最终回复绝大部分 token 来自模型。这种“定位-修正-继续”循环不仅将中位标注时间降低 52%,更使所得数据天然适合构造 on-policy SFT 与偏好对。
  • 标注过程中记录的 token 级修正提供了精确位置与自然配对的正负样本,构成现有对齐数据缺失的细粒度监督信号。主流偏好数据集通常只给整句或整轮偏好,不指示何处出错、如何修正;onPanda 的修正日志却每个错误 token 都有位置、候选替代和最终选择。这为 token 级奖励建模、细粒度 DPO 变体或诊断模型弱点开辟了新可能,也使数据能同时服务于 SFT 与偏好学习。

方法

输入为 prompt 与初始模型响应(on-policy 采样)。核心是 token-level correction 交互:标注者阅读响应,定位第一个不合适 token,然后二选一:从模型候选 token 中挑选替代,或自由编辑输入正确文本。系统截断该 token 之后的所有内容,以修正后的前缀继续自回归生成,循环执行 locate→correct→continue,直到响应满意。

关键模块:

  • Token-Level Correction Engine:实现截断与继续生成,记录每次修正的精确 token 位置与候选选择。
  • Annotation Tree and Data Protocol:保存完整修正轨迹,形成树状结构,每次修正生成自然配对的正负样本(原始 token 为负,替代 token 为正)。
  • Agentic and Multimodal Annotation:对接外部工具与 harness,支持交互式 agent 轨迹标注。

输出包括最终响应与 token 级监督信号,可直接构建 on-policy SFT 与偏好数据。与传统手工后编辑不同,onPanda 保留大部分模型原始生成 token,使数据分布更贴近模型自身采样,同时提供细粒度位置指导。

实验

实验设计

作者进行了一项小规模对照研究,对比 onPanda 与 手动后编辑 的标注效率与数据质量。标注任务为修正 LLM 回复中的不当 token,记录标注时间与生成数据的分布特性。onPanda 采用 locate-correct-continue 循环:标注者定位第一个不合适的 token,选择候选替换或自由编辑,系统截断后续并继续生成,直至回复满意。同时评估了 token-level corrections 作为监督信号的有效性,并验证了多模态与 agent 轨迹标注的可行性。

关键发现

  • 效率显著提升:onPanda 将中位标注时间降低 52%(对比手动后编辑),标注者仅需纠正关键 token 而非全文重写。
  • 数据分布保留:最终回复中绝大部分 token 由模型自身生成,数据更贴近模型采样分布,适合构建 on-policy SFT 和 偏好数据。
  • 细粒度监督:token 位置与候选替换形成天然的正负样本对,可提供比传统偏好标签更丰富的训练信号。
  • 扩展能力:支持外部工具与 harness 连接,适用于交互式 agent 轨迹标注;已发布 Panda-CVL 数据集。

与基线对比解读

与手动后编辑相比,onPanda 的核心差异在于交互范式的转变:手动后编辑要求标注者审阅完整回复并逐处修正,而 onPanda 将修正动作前置到生成过程中,利用模型自回归特性局部截断续写。这不仅大幅减少标注时间,还保留了模型输出分布,避免了全量改写带来的分布偏移。此外,token-level corrections 记录的精确位置和候选 token 信息为后续模型微调提供了可解释的监督,可能替代或补充 reward model 训练所需的偏好对。该设计在标注成本和数据质量之间取得了更好的平衡,尤其适合需要快速迭代的 on-policy 数据生产流水线。

行业影响

落地场景

onPanda 适合所有需要高质量 on-policy 对齐数据的团队,尤其是自研 LLM 或 agent 的企业。典型场景包括:

  • 电商智能客服:标注员快速修正对话回复中首个不当 token,系统续写后续回复,生成高质量客服语料。
  • 内容平台内容审核与生成:对模型输出进行 token 级纠正,积累偏好数据用于 RLHF/DPO。
  • 企业服务中的 agent 轨迹标注:连接外部工具后,标注 agent 在真实环境中的决策轨迹,提升工具调用与规划可靠性。

商业价值

核心降本:onPanda 将中位标注时间降低 52%,在人工标注成本高昂的 LLM 对齐数据生产中能直接节省预算。同时,标注数据大部分 token 来自模型自身采样,保留 on-policy 分布,更适合训练 SFT 与 preference 模型,可提升下游模型性能,减少数据分布偏移带来的训练不稳定。token 级修正还提供精确位置标注和自然正负样本对,可用于更细粒度的监督信号,增加数据资产复用价值。

与现有产品/工作流接口

onPanda 可作为标注前端嵌入现有数据标注平台(如 Label Studio),通过推理服务(如 vLLM 或 TGI)实时获取模型候选 token。输出为包含 token 级修正的 JSONL 标注树,可直接用于 SFT、DPO 等训练管线。其连接外部工具和 harness 的能力,可与 LangChain、AutoGen 等 agent 框架配合,将交互轨迹标注纳入统一数据采集流水线。

局限

  • **用户研究规模较小**:论文仅通过“小规模受控研究”报告效率提升(中位标注时间减少 52%),样本量、标注者背景与任务分布未充分披露,可能不足以支撑统计显著性。仍需更大规模、更多样标注者的验证,才能可靠评估 onPanda 在实际生产标注流程中的效率增益与可用性。
  • **token-level 修正的适用范围边界**:该方法假设错误可以通过定位到第一个不恰当 token 并替换/续写来修正,但对于需要全局一致性调整(如逻辑结构错误、跨段落语义冲突)的响应,仅替换单个 token 后重新生成可能无法根治,甚至引入新的偏差。此外,标注者必须准确识别第一个错误位置,这对长文本或复杂 agent 轨迹造成认知负担。
  • **数据集与基准的覆盖度**:摘要未详细说明 Panda-CVL 的领域分布、语言覆盖率及与现有对齐数据集的差异;若仅覆盖有限任务或来自特定模型,则基于该数据训练的模型泛化性存疑。此外,token-level correction 基准的评估协议尚不明确,可能限制与后续方法的公平比较。
论文Lei Yang2026-09-21原文

相关内容