论文

TimeEvo: 失败驱动的时间序列 Agent 自我演化

TimeEvo: 失败驱动的时间序列 Agent 自我演化

时间序列 agent 通过调用外部工具来回答分析类问题,而携带哪些工具由人在 agent 运行前决定。我们在此设置下发现了两类失败: - Human-Agent Tool Misalignment(人-Agent 工具错配):一个由 21 个专家精选工具组成的工具库,在某些任务上有帮助,在另一些任务上却有害,在我们测试的每个 backbone 上都拉低了 anomaly 准确率。 - Silent Harm(静默伤害):一轮通用的自我修订改动了 147 个答案,破坏了其中 56 个,而最终分数变动不到一分。 两者都源于同一个缺口:工具是否有帮助,是在运行时逐题决定的;而工具却是预先提供、并以单一平均值来评判的。 为此我们提出 TimeEvo:它将 agent 被诊断出的失败聚类为能力缺口,为每个缺口规划一项度量,合成只含证据的工具来填补缺口,并且只通过成对准入门(paired admission gate)接纳候选工具库。 在十个时间序列 QA 任务和三个 backbone 上的实验表明,TimeEvo 从空工具库出发,在每个任务和每个 backbone 上都提升了准确率;并且在一个廉价模型上生长出的工具库,安装到更强的模型上时依然能带来增益。代码见 https://github.com/Muyiiiii/TimeEvo。

论文精读

TL;DR TimeEvo 让时间序列代理从失败中自我进化:聚类能力缺口、合成证据工具、配对门控录取。从空库起步,全任务全模型一致提升,且工具库可跨模型迁移。

问题

问题背景

当前时间序列分析正从传统统计模型转向基于 LLM 的 time series agent,这些 agent 通过调用外部工具(如 anomaly detector、forecaster)完成分析问答任务。业界关注点集中在如何提升自动化分析与问答准确率,以及工具库的工程化管理。

现有方法局限

  • Human–Agent Tool Misalignment:人工预先筛选工具库,按平均准确率评判工具价值,忽略了工具帮助性的问题级差异。论文实验显示,一个包含 21 个专家工具的工具库在 anomaly 任务上对所有 backbone 都导致准确率下降,说明静态工具库可能产生负面影响。
  • Silent Harm:单轮通用 self-revision 修改了 147 个答案,其中 56 个被破坏,但最终总分变化不足 1 分。这种无针对性的自修订会引入隐性错误,且难以通过总体指标察觉。

为什么这个问题难 / 重要

核心矛盾在于:工具是否有助于回答取决于运行时每个具体问题的特征,但工具库被提前静态提供、按单一平均指标评估。因此需要 失败驱动 地自动诊断能力缺口、合成证据型工具,并通过 配对准入门禁 仅在工具对具体问题有益时才引入。技术挑战包括如何聚类失败模式、规划测量、合成有效工具并验证其局部增益而非平均增益,同时避免工具库膨胀带来的隐性性能损失。该问题直接关系到生产环境中 agent 工具链的质量与可靠性,是时间序列 agent 落地的重要障碍。

行业类比

类似 LLM 应用中的工具选择工程:与其依赖人工维护全局工具集,不如像动态路由或推荐系统一样根据查询实时匹配工具,避免静态工具库带来的隐性性能退化。

核心洞察

  • - 工具对 agent 的帮助与否取决于具体问题上下文,而非工具库的平均效用。现有工具增强 agent 通常在运行前固定供应一套专家工具,并用单一平均分评估;而 TimeEvo 发现同一工具库在不同任务上表现分化,甚至拉低异常检测准确率。TimeEvo 改变范式:从空库出发,通过聚类诊断后的失败识别能力缺口,按需合成证据 only 工具,把工具选择从离线全局判断转化为运行时逐样本适配。这种 failure-driven 闭环与一次性工具库建设形成根本差异。
  • - 通用自我修正存在 Silent Harm,平均分数掩盖了答案翻转的净损失。TimeEvo 发现一轮通用 self-revision 改变 147 个答案、破坏 56 个,最终分数变化不到 1 分;而现有 self-refine 工作大多只看最终准确率,忽略了对已正确样本的伤害。TimeEvo 的 paired admission gate 强制候选工具在每一对原始-修正样本上实现净增益才被接纳,从而避免引入隐性退化。这一机制将评估粒度从全局平均下放到样本配对层面,是防止自进化过程中静默伤害的关键设计。

方法

输入与流程

TimeEvo 从空工具库开始,输入一个时间序列问答任务集,agent 先执行并收集被诊断为失败的案例。

关键模块

  1. 失败聚类:将失败案例按能力缺口聚类,例如缺少趋势分解、异常检测或周期性度量等能力,每个簇代表一个可填补的缺口。
  2. 测量规划:对每个能力缺口设计一个可量化的验证方案,例如在该缺口对应的失败子集上评估准确率变化。
  3. 工具合成与预筛:针对缺口合成只提供证据的工具,即工具输出中间统计量或分析结果,而不直接给出最终答案,避免过度干预 agent 推理;预筛阶段用启发式规则过滤明显低效的候选工具。
  4. 配对准入门控:将每个候选工具与不使用该工具的基准进行逐问题配对比较,只有当工具在问题粒度上带来稳定增益时才允许进入库,而非基于整体平均分数。

输出与迭代

输出为更新后的工具库,可进行多轮进化。整个过程保持冻结残差推理,即新工具作为残差补充到原始推理路径,不覆盖已有能力。

与同类自我进化方法的差异:TimeEvo 不依赖统一奖励函数或平均指标做工具增删,而是用配对测试在单个问题上验证工具的真实收益,并显式建模能力缺口。

实验

实验设计

论文在 10 个时间序列 QA 任务 与 三个 backbone 上评估 TimeEvo。实验从 空工具库 开始,让 Agent 通过失败驱动的方式自进化工具库。对比基线包括:

  • 专家工具库:21 个专家精选工具,发现其在某些任务上有害,在所有 backbone 下降低 anomaly accuracy。
  • 通用自修订:一轮自修订改变 147 个答案,破坏 56 个,最终得分变化小于 1 分。

关键发现

  • TimeEvo 在每个任务和每个 backbone 上均提升 accuracy。
  • 在 低成本模型 上进化出的工具库,安装到 更强模型 后仍带来增益,表明能力缺口具有跨模型迁移性。
  • 失败诊断 → 能力缺口聚类 → 证据工具合成 → 配对准入门控的流程,有效避免了平均有益但个别有害的工具误配。

与基线对比解读

专家工具库采用平均指标决策,无法覆盖运行时逐题变化;而 TimeEvo 将“工具是否有用”的判定后移到逐题执行,并通过配对准入门控筛选,只保留真正补缺的证据工具。通用自修订则缺乏针对性,改动多但净收益近零。TimeEvo 的失败驱动机制将修改约束在诊断出的能力缺口内,因此能稳定提升。

行业影响

落地场景

TimeEvo 可嵌入任何调用外部工具的时间序列分析 Agent,典型场景包括:

  • 金融风控:异常交易检测、波动率预测,Agent 根据历史失败自动合成针对特定市场状态的特征工具。
  • 工业 IoT 监控:传感器数据流异常识别,无需人工枚举所有统计量,Agent 根据线上误报案例动态补充探测工具。
  • 电商需求预测:促销、季节性等复杂模式下的销量预测,Agent 自我演化出事件驱动的回归工具。
  • IT 运维 / AISec:日志指标关联分析,针对新型故障模式快速生成检测工具。

商业价值

TimeEvo 从成本与效果两端同时获益:

  • 降低专家维护成本:传统工具库依赖领域专家反复设计、评测、筛选,TimeEvo 自动聚类失败、计划测量、合成候选并通过配对准入门筛选,大幅减少人工介入。
  • 提升业务准确率,减少误报漏报:论文显示在 10 个任务 3 个 backbone 上全线提升,从空库开始即可超越人工精心设计的 21 工具库,直接降低异常漏检带来的资金损失或系统宕机风险。
  • 模型无关的迁移收益:在便宜模型上生长的工具库安装到更强模型后仍能带来提升,使企业能用低成本模型完成工具进化,再用高精度模型部署,优化推理成本。

与现有产品/工作流的接口

TimeEvo 作为一个离线工具库自进化层,接入方式轻量:

  1. 现有 Agent 工具调用层:在 Agent run 之前或离线阶段,将历史诊断结果输入 TimeEvo,产出新工具并更新工具注册表,不改动推理主链路。
  2. MLOps 流水线:可配置为周期性任务,每次迭代产出候选工具库,通过配对准入门自动验证,通过后发布到线上 Agent,形成持续进化闭环。
  3. 与观测平台集成:从监控系统拉取失败案例与日志,回写工具版本,实现数据驱动的 Agent 能力迭代。

具体 Use Case

  • 信用卡欺诈检测:某银行反欺诈 Agent 初始只有基础统计工具,在线上运行一段时间后,TimeEvo 根据误判交易的时间模式生成针对夜间小额连续交易的专用特征工具,提升欺诈召回率,减少人工复审成本。
  • 电商平台流量异常检测:大促期间流量模式异于日常,原工具库失效,TimeEvo 自动合成针对促销脉冲的检测工具,避免因误报导致的营销资源错配。

局限

  • **失败诊断与工具合成的可靠性存疑**。TimeEvo 依赖 **冻结残差推理** 定位失败,若初始模型能力不足或任务分布不均,聚类出的能力差距可能偏差;**证据工具合成** 由 LLM 生成,可能引入幻觉或冗余工具,即使有 **配对准入门控** 也需要额外数据与评估成本。论文未量化错误诊断或冗余工具对最终库的影响,也未讨论诊断失败时的补救机制,这在实际工程中可能造成工具库污染。
  • **实验范围与资源开销不明确**。实验仅在 10 个时间序列 QA 任务和 3 个骨干模型上进行,任务类型偏向分析查询,未覆盖预测、分类、补全等更广泛的时间序列任务;论文未报告进化迭代的时间、token 成本或 GPU 消耗,对于资源受限环境下的实际部署难以评估。此外,从空库开始进化需要多轮迭代,且每轮包含诊断、合成、准入多个阶段,计算效率可能成为瓶颈。
  • **与现有自进化框架对比不足**。论文主要与静态工具库和单轮自修订对比,未直接对比 **Tool Creation** 类方法(如 CREATOR)、**自进化代理**(如 Voyager)在时间序列场景下的表现,因此其相对增益可能部分来自工具设计本身而非进化机制;且仅展示从弱模型到强模型的迁移有效,未讨论强模型到弱模型或跨任务迁移的局限性,泛化边界尚不清晰。
论文Jie Yang2026-09-23原文

相关内容