Using Grounded Theory for Agent Behavior Analysis at Scale
理解智能体行为需要能扩展到数千条轨迹的方法,并在长程且不熟悉的任务中发现新模式,而预构建的分类器在此类场景中往往失效。我们提出将扎根理论引入智能体轨迹分析——一种源自社会科学、已有六十年历史的定性方法,具备原理性饱和准则及从数据到理论的可审计路径。 我们提出AutoTraceGT(基于扎根理论的自动化轨迹分析),这是首个在智能体轨迹上自动化扎根理论的多智能体流水线。它迭代执行开放编码、轴心编码与理论编码直至饱和,为每项任务生成定制的行为分类体系。 在六个轨迹语料库上,AutoTraceGT 生成的编码本可恢复人类标注分类中 73%–91% 的失败模式,并浮现出这些分类遗漏的额外模式。涌现的理论叙述与先前的专家描述一致。当用作演绎特征空间时,该编码本在下游失败预测任务上优于零样本与少样本 LLM 基线。这些结果表明,扎根理论为机器学习研究者和智能体开发者提供了一种可扩展的分析工具,用于研究智能体的实际行为。
论文精读
TL;DR AutoTraceGT 将扎根理论自动化,对 agent 轨迹做多智能体迭代编码至饱和,生成任务专属行为分类法,恢复 73-91% 人工失败模式并发现新模式,下游预测超越 LLM 基线。
问题
问题背景
LLM 驱动的智能体(agent)在长程、开放任务中产生大量轨迹数据,理解 agent 实际行为(尤其是失败模式)已成为评估与改进系统的关键环节。
现有方法局限
- 预定义分类器 依赖人类先验构建失败类型,面对陌生任务或罕见模式覆盖率低,无法应对长尾与演化中的行为。
- 零样本/少样本 LLM 判别 常需预先给定类别,且缺乏系统归纳能力;对上千条轨迹做细粒度标注时成本高、可复现性差,解释性弱。
- 纯统计聚类(如语义聚类)虽能分组轨迹,但产生的是无结构簇,难以形成可解释的行为类别或理论叙事,也无法提供从数据到结论的审计轨迹。
为什么这个问题难/重要
- 规模化与陌生性矛盾:大量轨迹需自动化处理,但任务本身可能尚未被充分理解,无法预定义有效分类体系。
- 可审计性要求:研究与工程决策需要从原始轨迹到行为结论的可追溯链条,而非“黑箱”标签。
- 业界关注度:agent 部署后故障诊断、安全审计、回归测试均依赖行为分析;传统定性方法(如 grounded theory)可靠但人工成本极高,无法扩展至 ML 数据规模。
AutoTraceGT 将扎根理论(grounded theory)的开放/轴向/理论编码自动化,提供饱和判据与全程 audit trail,目标是让定性方法的严谨性在大规模轨迹上可用。
行业类比
类似 自动驾驶路测日志分析:人工逐帧标注异常行为不可行,必须从海量数据中自动归纳出可解释的驾驶失败模式,并给出从原始传感器数据到安全结论的证据链。
核心洞察
- 将扎根理论(grounded theory)的定性编码流程自动化并应用于智能体轨迹分析,是本文的核心方法论创新。与传统使用预定义分类器或零样本/少样本 LLM 直接分类不同,AutoTraceGT 通过多智能体迭代执行开放编码、轴向编码、理论编码直至饱和,能够从长轨迹中自下而上地涌现任务特定的行为分类法,无需先验标签,并保留从数据到理论的可审计链条,解决了陌生任务中分类器难以预先构建的问题。
- 多智能体角色分工与 constant comparison 机制模拟了人类定性研究者的协作与理论构建过程,保证了 codebook 的稳定性和覆盖率。在六个轨迹语料上,该方法恢复了 73-91% 的人类标注失败模式,并发现了额外模式,说明其不仅复现已知知识,还能扩展认知边界;其生成的 codebook 作为演绎特征空间用于下游失败预测时,超越了零样本和少样本 LLM 基线,表明定性归纳的结构化知识可直接转化为可靠的模型特征,为智能体行为分析提供了归纳-演绎结合的新范式。
方法
输入与初始化
- 大规模 agent 轨迹(可能包含成功/失败标签,但无需预设类别)
- 多个 LLM agent 分别承担开放编码、轴心编码、理论编码、代码簿管理角色
关键模块
- 开放编码(open coding):对每条轨迹逐段或整体生成初始行为代码,不做归类限制,保留原始细节。
- 轴心编码(axial coding):每轮采样结束后,聚合开放代码,建立类别之间的维度与属性关系。
- 理论编码(theoretical coding):在全局层面对主轴类别做进一步抽象,形成核心范畴与叙事。
- 代码簿管理(codebook management):跨轮次执行 constant comparison,合并、拆分或重命名代码,并维护审计轨迹。
- 饱和判定(saturation):当新一轮采样不再产生新的代码或关系时停止迭代,输出饱和代码簿。
输出
- 任务特异的行为分类体系(codebook),能恢复人工标注失败模式并发现额外模式。
- 代码簿可直接作为演绎特征空间,用于下游失败预测。
与同类方法差异
- 不同于预构建分类器或一次性 LLM 标注,AutoTraceGT 采用多 agent 迭代编码与饱和准则,从数据中自下而上构建可审计的行为理论。
实验
实验设计
AutoTraceGT 在六个 trajectory corpora 上迭代执行 open coding、axial coding 与 theoretical coding 直至饱和,并围绕两个研究问题展开:RQ1 评估流程可靠性,包括覆盖率稳定性、饱和判定与审计轨迹;RQ2 评估产物质量,重点对比人类标注的失败模式 taxonomy、专家理论叙事以及下游失败预测任务中的表现。
关键发现
- 与人类标注 taxonomy 对比,AutoTraceGT 恢复 73-91% 的失败模式,且能发现人工 taxonomy 遗漏的额外行为模式。
- 生成的 theoretical narrative 与先前专家分析一致,表明多智能体编码过程能捕捉到可解释的行为机制。
- 将 codebook 作为 deductive feature space 用于下游失败预测时,性能优于 zero-shot 与 few-shot LLM 基线。
与基线对比解读
与依赖预构建分类器或一次性 LLM prompt 的方法不同,AutoTraceGT 的 grounded theory 流程具备 principled saturation criterion 和从数据到结论的审计链路,更适合在长尾、不熟悉任务中发现新的行为类别。其多智能体框架将质性编码原则自动化,既能扩展到数千条轨迹,又保留了 constant comparison 的可追溯性,为 agent 行为分析提供了一种可工程化的质性研究工具。
行业影响
落地场景
AutoTraceGT 适合对大规模 Agent 执行轨迹做事后定性挖掘,典型场景包括:
- AI 客服 Agent:分析数千轮对话轨迹,自动归纳高频失败模式(如误解意图、工具调用错误),生成可读的行为分类学。
- 代码生成/调试 Agent:对 CI 中失败的 agentic workflow 做行为聚类,识别模式化失误。
- 多智能体系统:持续监控 agent 交互序列,发现涌现的非预期协作行为。
商业价值
- 降低人工审计成本:传统定性分析依赖专家逐条阅读轨迹,AutoTraceGT 自动化开放/主轴/理论编码,可扩展到万条级数据。
- 提升系统可靠性:产生的 codebook 作为可复用特征空间,用于下游失败预测,论文显示优于 zero-shot / few-shot LLM 基线,意味着更强的风险拦截能力。
- 加速迭代闭环:行为分类学可成为产品团队的共享语言,缩短从“发现异常”到“修复提示/工具”的周期。
与现有工作流集成
- 可观测性平台(如 LangSmith、W&B Weave):将 AutoTraceGT 作为后处理管道,对已收集的 trace 数据定期运行,输出 updated codebook。
- LLM-as-a-Judge 评估:用生成的行为分类替代手写失败标签,动态调整评估 bucket。
- CI/CD 中做回归门禁:将 codebook 转为分类器,对每次 agent 版本发布自动标记高风险行为。
具体落地 use case
- 电商智能客服 Agent:某平台部署的 LLM 客服每天产生数十万次对话,人工抽检只能覆盖 1%。AutoTraceGT 可对全量采样轨迹自动编码,产出“退换货流程理解错误”“物流查询 API 参数缺失”等类别,作为特征集训练失败预测模型,将客诉升级率降低 15%+(假设,需验证)。
- 企业级 RPA/工作流 Agent:对自动化财务审批、数据录入等任务,行为分类学能揭示系统性错误(如规则误用、权限越界),直接嵌入 workflow 监控面板,实现准实时风险预警。
局限
- **依赖 LLM 编码质量**:AutoTraceGT 的核心编码步骤均由 LLM 完成,尽管通过多智能体对话与饱和判据缓解幻觉,但未系统评估 LLM 生成代码的语义效度。论文仅在附录中做了有限的人类审计,未报告编码者间信度(inter-coder reliability)或与资深定性研究者的系统对比,可能掩盖系统性偏差。
- **下游评估基线较弱**:失败预测实验仅与 zero-shot 和 few-shot LLM 基线比较,没有纳入经过微调的分类器、基于手工特征的传统 ML 模型或其他专门的行为分析工具。这导致无法判断 codebook 作为 deductive feature space 的增益是否主要来自 LLM 本身能力,还是来自 grounded theory 结构化流程。
- **泛化性与可扩展性待验证**:在六个轨迹语料上测试,但覆盖领域有限,且未说明语料规模、多样性对饱和判据的影响。多轮编码的计算成本与延迟较高,实际部署时可能不适用于实时或超大规模轨迹流。