论文

EvolveTrade: 面向自演化 LLM 交易智能体的经验驱动策略精炼

EvolveTrade: 面向自演化 LLM 交易智能体的经验驱动策略精炼

LLM 交易智能体虽能整合市场数据、新闻与可执行分析,但其行为往往由部署前固定的静态手工工具使用策略控制,难以在变化的市场环境中自适应地收集证据、调用工具、验证信号与管理风险。 为此,我们提出 EvolveTrade,一个自演化框架:将工具型交易智能体的系统提示视为文本参数化策略。每个更新周期结束后,由 Policy Agent 依据累积的决策轨迹与已实现的组合反馈修订该策略,同时保持骨干 LLM 固定不变;更新后的策略用于下一批交易决策,使智能体随时间不断精炼其信息获取与组合构建流程。 实验覆盖多种市场状态与两个 LLM 骨干,结果显示 EvolveTrade 在多数评测设置中相较固定策略基线提升了 Sharpe Ratio 与累计收益(CR)。行为分析进一步表明,自演化策略提升了代码介导的分析量并激活了与市场状态相关的计算;案例层面的策略—收益归因追踪了策略引发的配置变化如何贡献于实际收益差异。 这些结果说明,自适应地调整可复用的工具使用流程,是构建更稳健 LLM 交易智能体的关键方向。

论文精读

TL;DR EvolveTrade 将 LLM 交易代理的系统提示视为可迭代的策略参数,用交易轨迹与收益反馈驱动策略代理自动修订提示词,在不更新 LLM 权重的情况下提升夏普比率和累计收益。

问题

问题背景

LLM 交易代理已经能整合市场数据、新闻与可执行分析,但研究重心多在单次工具调用与推理链路,而系统提示(system prompt) 这一控制行为流程的策略在部署后往往保持不变。

现有方法局限

静态手工编写的工具使用策略存在四类限制:

  • 工具流程固定:信息获取、信号验证、风险管理步骤不能随市场状态切换。
  • 缺乏策略级反馈:模型权重冻结时,文本策略没有来自 realized PnL 的奖励信号,类似 text-parameterized policy 未被优化。
  • 规则与回撤脱节:例如基准策略在 NVDA 回撤前未降低敞口,因为其组合规则不会从历史决策轨迹中学习。
  • 更新依赖人工重写:遇到 regime 变化只能在离线重新设计提示词,延迟高且难以规模化。

为什么这个问题难/重要

  • 金融时间序列非平稳,趋势、高波动、横盘等 regime 对同一条策略要求矛盾,静态提示词难以全覆盖。
  • 信用分配困难:组合收益来自多步决策的累计效应,很难把回撤差异归因到某一句策略文本。
  • 文本策略搜索空间 大且不可微,直接梯度优化不可行;需要利用决策轨迹做在线策略探索。
  • 对落地 LLM trading agent 的团队而言,固定模型下持续改善行为是一线工程刚需,而现有 adaptive agent / self-refine 工作多在任务级 prompt 优化,缺少 portfolio-level 反馈闭环。

行业类比

类似自动驾驶的“驾驶策略 OTA 更新”:感知与规控模型不变,但根据真实路测数据持续优化决策规则,而非仅靠出厂标定。

核心洞察

  • - EvolveTrade 将工具调用型交易智能体的系统提示视为一种文本参数化策略,并通过“决策轨迹 + 已实现组合收益”反馈让 **Policy Agent** 在线更新该策略。与静态提示工程或直接微调 LLM 权重不同,它保持骨干模型固定,只演化可复用的行为规程,因此更新成本低、可解释性强,且能适应市场 regime 漂移。
  • - 核心机制是在不改变 LLM 的前提下,通过策略文本的迭代重写实现行为自适应。**Policy Agent** 归纳历史交易中的工具使用模式与回报归因,生成新的 `system prompt`,使后续决策自动激活 regime 相关的分析计算。相比 SFT 或 RLHF 需要大量标注和算力,该方法只需少量交易轨迹即可在线迭代,更适合金融场景的持续部署。

方法

EvolveTrade 将工具使用型 LLM 交易代理的系统提示视为 文本参数化策略,通过在线经验闭环迭代该策略,而非微调 backbone LLM。

  • 输入:当前市场数据、新闻、可执行分析工具;交易代理产生的决策轨迹(工具调用序列、中间推理、代码执行结果);以及已实现的组合收益反馈(如 Sharpe Ratio、回撤、盈亏)。
  • 关键模块:
    1. 交易代理:按系统提示执行工具调用、信号验证与下单;
    2. 经验库:按固定更新间隔聚合决策轨迹与收益反馈;
    3. Policy Agent:独立 LLM 模块,读取经验库,输出新的系统提示文本,对信息采集、风险控制等规则进行增删或重排;
    4. 策略替换:新提示注入交易代理,驱动下一批决策。
  • 输出:演化后的系统提示,使代理在后续时段调整工具使用模式与仓位行为,如激活 regime 相关计算、提前降仓。

与同类方法的差异:传统 LLM 交易代理依赖部署前手工编写的静态工具使用策略;EvolveTrade 首次将可复用的程序性策略作为在线优化对象,仅通过提示文本更新实现经验驱动行为改进,无需修改底层模型权重。

实验

实验设计

论文在多个市场制度(regimes)和两个 LLM 骨干上评估 EvolveTrade,对比固定手写 tool-use 策略的基线。环境提供市场数据、新闻与可执行分析接口;代理在每个更新间隔后由 Policy Agent 根据累积决策轨迹与组合反馈修订 system prompt,再用于下一批交易决策。评估指标包括 Sharpe Ratio 与 Cumulative Return,并做 trading friction、更长交易周期与不同更新间隔的消融。

关键发现

  • 在大多数设置中,EvolveTrade 的 SR 和 CR 优于固定策略基线。
  • 行为分析显示自进化策略增加 代码中介分析(code-mediated analysis),激活了基线从未调用的 regime-relevant 指标。
  • 案例归因表明策略诱导的配置变化(如回撤前限制 NVDA 敞口)直接贡献收益差异;中等更新间隔平衡适应性与稳定性。

与基线对比解读

固定策略将 LLM 锁定在不变的证据收集与风控流程,无法适应市场制度切换。EvolveTrade 通过文本参数化策略在线调整 tool-use 过程,在不微调 LLM 的前提下提升了鲁棒性。这验证了“调整可复用工具使用程序”是构建鲁棒 LLM 交易代理的关键方向,与依赖静态提示或一次性微调的范式形成对比。

行业影响

落地场景

EvolveTrade 适合所有基于 LLM 的金融决策智能体,包括量化交易、智能投顾、风险监控等产品。具体场景:

  • 多资产组合管理:LLM agent 动态收集新闻、财报、行情数据并执行交易,EvolveTrade 让 system prompt 根据市场 regime 自动进化,适配趋势、震荡、高波动等不同阶段。
  • 自适应投研助手:券商或数据平台内置的 LLM 研究 agent,可在用户提问时自动调整工具调用顺序和分析重点,例如从技术面切换到基本面。
  • 合规与风控报告:agent 需要根据监管变化或市场事件调整证据收集流程,EvolveTrade 可优化其验证步骤和风险提示。

商业价值

核心价值在降本与增收两条线:

  • 降本:传统做法需要人工定期重写交易 agent 的 system prompt 或维护复杂的规则库。EvolveTrade 将这一过程自动化为在线策略优化,减少策略维护人力,同时避免频繁重新训练 LLM 的高昂成本。
  • 增收:论文实验显示 Sharpe Ratio 与 Cumulative Return 在多数市场 regime 下均有提升,直接改善投资业绩。案例中策略主动限制 NVDA 暴露,降低了回撤风险,这类自适应风险控制对资管产品吸引力极强。
  • 体验提升:投顾客户获得更稳健、更符合当前市场环境的建议,减少因固定策略失效导致的信任流失。

与现有产品/工作流的接口

EvolveTrade 可以作为轻量级策略管理层接入现有量化平台:

  • 集成方式:在已有 LLM trading agent 外层增加一个 Policy Agent,定期(如每周)读取决策轨迹与组合盈亏,输出修订后的 system prompt,再用于下一轮决策。无需改动 backbone LLM。
  • 基础设施兼容:可对接 MLflow、LangSmith 等 LLMOps 工具,将交易轨迹和绩效数据作为 policy refinement 的输入。回测引擎和实盘执行模块无需重构。
  • 模型无关性:论文验证了两种 LLM backbone,说明该方法可适配 GPT-4、Claude 或开源模型,降低迁移成本。

具体落地 use case:

  1. 量化对冲基金:使用 EvolveTrade 优化其 LLM 股票多空策略。每两周根据持仓盈亏和宏观事件更新一次 agent 的 tool-use 指令,例如在高波动期自动增加波动率指标分析、减少财报前重仓。
  2. 数字财富管理平台:如智能投顾产品,为每个用户组合生成个性化 LLM 建议。EvolveTrade 根据用户风险偏好和市场 regime 动态调整投资规则,例如在利率上升周期自动提高债券 ETF 权重,同时保留解释性文本。

局限

  • 论文附录 F 明确指出 EvolveTrade 在四月市场 regimes 下表现不佳,说明方法对特定市场状态敏感。其改进并非在所有窗口上都稳健,某些时段可能无法超越静态策略基线的收益,甚至会因为策略更新方向错误而降低表现。这种 regime 依赖限制了其在高度非平稳真实市场中的普适性,尤其当市场快速切换且历史数据不足以支撑策略 agent 有效归纳时,自演化可能带来方差增大而非稳定提升。
  • 从方法设计看,EvolveTrade 完全依赖 LLM 作为策略修订器,策略 agent 的推理质量直接决定演化方向。若 backbone LLM 能力较弱或上下文过长导致注意力分散,可能生成次优或矛盾的系统提示,造成策略退化。此外,更新间隔是一个需要人工调节的超参数,论文未给出自动化选择机制;在线交互和存储全量决策轨迹的成本较高,实际部署中反馈延迟与数据稀疏也可能限制其快速适应能力。
  • 与基于参数微调(如强化学习更新 LLM 权重)的自改进 agent 相比,EvolveTrade 只优化文本形式的系统提示,策略表达空间受限于自然语言描述,可能无法捕捉复杂的非线性决策模式。同时,实验仅在两个 LLM backbone 和有限时间区间上评估,未测试更大规模模型或极端市场事件,泛化证据不足。与同期的 textual gradient 类方法相比,它增加了领域特有的交易反馈,但整体思路仍属于渐进式扩展。
论文Sehee Kim2026-09-15原文

相关内容