论文

大语言模型能否执行 Parent Orders?

大语言模型能否执行 Parent Orders?

母单执行 是算法交易的核心问题,目标是将大订单拆分为小订单以降低执行成本。现有方法要么依赖预设的市场假设(现实中可能不成立),要么需要任务特定训练(限制了对新环境的适应性)。 为克服这些限制,我们首次系统研究了大语言模型 (LLMs) 在母单执行中的应用,将 LLMs 在金融中的使用从“交易什么”扩展到“如何执行”。我们提出 PACE (Plan-Ahead Controlled Execution),一个分层框架,将母单执行分解为长期规划 与 短期执行,既无需显式市场假设,也无需任务特定训练。 在 深圳证券交易所 Level-1 数据 上的实验表明,PACE 显著优于 TWAP、Almgren-Chriss 及基于学习的基线,超过最强基线 0.65 bps。行为分析还发现,LLMs 的决策方式与人类投资者不同:更高的模型置信度预测更好的表现(而非更差收益),且模型倾向于更早交易,而非拖延至截止时间。这些结果表明,LLMs 可在执行决策中有效辅助人类交易者。

论文精读

TL;DR 首次将 LLM 用于母单执行,提出分层框架 PACE,不需市场假设与任务训练,效果超最强基线 0.65 bps,模型高信心指示更好表现。

问题

问题背景

父订单执行(parent-order execution)是算法交易的核心:如何将一笔大宗订单拆分为多个子订单,在指定时间内完成交易,同时最小化对市场的冲击和滑点成本。随着电子化交易的普及,金融机构对执行算法的性能要求持续提升,细微的成本节省即可带来可观的竞争优势。

现有方法的局限

传统执行策略依赖对市场行为的简化假设,例如:

  • TWAP(时间加权平均价格)假设各时段成交量分布均匀,未利用实时市场信号。
  • Almgren-Chriss 框架基于预定义的波动率和永久/临时价格冲击模型,但这类参数在实践中难以准确估计,且假设市场平稳,无法适应突发波动。
  • 基于强化学习的方法虽然能从历史数据中学习执行策略,但通常需要针对特定股票或市场状态进行大量任务特定训练(task-specific training),泛化到新股票或市场环境时代价较高,且行为可解释性差。

这些方法要么过于刚性,无法捕捉市场微观结构的动态变化;要么缺乏快速适配新场景的能力,限制了在实际生产环境中的广泛应用。

技术挑战与行业重要性

父订单执行的难点在于在长周期规划与短周期快速响应之间取得平衡:

  • 长周期:需根据剩余时间、剩余数量和当前价格走势动态调整执行进度,避免在不利价位集中成交。
  • 短周期:毫秒级的订单分片需即时决策,既要隐藏交易意图,又要应对订单簿的快速变动。

此外,市场微观结构(买卖价差、订单流不平衡)与宏观情绪(消息面冲击)交织,使最优执行策略呈现高度非线性和时变性。在全球算法交易市场,哪怕仅提升 0.65 bps 的执行质量,对管理大规模资产的机构而言都意味着巨大的成本节约,因此业界持续探索更智能、更通用的执行方法。

相关场景类比

这一问题可类比于 云资源调度 中如何在满足服务等级协议(SLA)的前提下动态分配计算任务,力求降低总能耗——既需要全局规划防止资源碎片化,又需要实时应对突发流量,且调度策略必须对不同负载类型具备通用性。

核心洞察

  • LLM 首次被证明能够执行父订单拆分,且无需任何显式市场假设或特定任务训练,这突破了传统策略对预设模型的依赖。PACE 框架通过分层设计(长周期规划+短周期执行)让 LLM 直接理解市场状态并做出顺序决策,在深圳交易所 Level-1 数据上以 0.65 bps 的优势超越最强基线。相比基于强假设的 TWAP/Almgren-Chriss 和需要重训练的 RL 方法,该方案对新市场环境具有更强的适应潜力。
  • LLM 在订单执行中展现出与人类交易者截然不同的行为模式:更高的模型置信度反而预测更好的绩效,且倾向于提前交易而非拖延至期末。这与行为金融中常见的过度自信导致亏损、拖延加剧市场冲击的规律相悖,说明 LLM 可能形成了一种更理性的决策偏好,为构建人机互补的交易系统提供了新证据。

方法

PACE (Plan-Ahead Controlled Execution) 是一种层次化框架,将父订单执行分解为长期规划与短期执行两个阶段,不对市场行为做显式假设,也无需针对特定任务训练。

输入

框架接收交易所 Level-1 行情快照(如价差、成交量模式)以及父订单参数(方向、总量、时间期限),并将这些信息组织成 LLM 可理解的文本序列。

关键模块

  • Planner(规划器):基于当前市场状态和剩余任务上下文,利用 LLM 的推理能力生成长时间尺度的“理想”成交量分布轨迹。该轨迹作为粗粒度引导,指示未来若干决策周期的建议交易量,而非强制执行的计划。
  • Executor(执行器):在每个决策时间点,结合最新市场快照和 Planner 提供的轨迹参考,由 LLM 输出即时子订单量。执行器可在不偏离长期目标的前提下,动态适应微观价格变化,平衡执行成本与市场冲击。

训练与推理

PACE 通过监督微调从历史最优执行轨迹中学习,避免强化学习在线交互的高方差与样本效率问题。推理时,Planner 先规划轨迹,Executor 再根据轨迹和实时数据逐步执行,两阶段均基于同一个 LLM 但使用不同提示上下文。

回测模拟

框架内置基于订单簿重构的回测环境,模拟滑点、交易量权重平均价格(VWAP)基准等执行成本指标,确保与现实交易约束一致。

与同类方法的差异

与传统模型(如 Almgren-Chriss)相比,PACE 无需预设价格过程或流动性假设;与学习型策略(如基于强化学习的方法)相比,PACE 不依赖针对特定市场状态或资产的任务特定训练,具备更强的泛化能力。

实验

实验设计

论文基于深圳证券交易所 Level-1 行情数据构建回测环境,对比了 PACE 与三类基线:

  • 传统策略:TWAP、Almgren-Chriss (AC)
  • 学习型策略:基于强化学习或模仿学习的方法
  • PACE 自身变体:消融规划器或执行器

评估指标为实际成交价相对目标基准的 执行成本(单位:bps)。所有策略在相同时间段、多支股票上测试,确保统计稳健性。

关键发现

  • PACE 在所有对比中取得最低执行成本,较最强学习型基线降低 0.65 bps。
  • 消融实验显示,去除长期规划(Plan-Ahead)或仅使用 LLM 做单步决策均会导致性能明显下降,验证了分层设计的必要性。
  • 行为分析揭示两个反直觉模式:
    • 高置信度决策带来更好而非更差的回报(传统认知中过度自信常导致亏损)。
    • 模型倾向提前交易而非拖延,这与人类交易员临近截止日才加速执行的行为不同。

深度对比解读

传统方法如 TWAP/AC 依赖强市场假设(如固定成交量分布、线性冲击),实际中常不成立;学习型方法需要针对特定股票、时间段重新训练,泛化成本高。

PACE 的核心优势在于 无需显式市场假设或任务特定训练:它将决策分解为 LLM 负责的宏观规划(时间、比例分配)和轻量级执行器负责的微观下单,两者结合使 LLM 能聚焦于更高层的市场模式理解。这种设计让模型对市场风格转换更鲁棒,也降低了部署到新品种时的适配成本。从工程角度看,该框架可以无缝接入不同 LLM 后端,且规划器输出的置信度可作为执行风险评估的参考信号,为实际交易系统集成 LLM 提供了可行路径。

行业影响

落地场景

PACE 框架可直接嵌入算法交易平台(Algorithmic Trading Platforms)与执行管理系统(EMS),为经纪商、对冲基金、资管公司提供智能父订单拆分服务。适用资产覆盖股票、期货及加密货币等连续交易品种。尤其适合缺乏历史回测数据的新兴市场或事件驱动场景,因无需预训练即可泛化。

商业价值

传统执行算法(如 TWAP、VWAP)依赖预设市场假设,在波动加剧时易出现大幅滑点;而基于强化学习的方法需要大量训练数据与工程投入。PACE 凭借 LLM 的通用推理能力,在深圳交易所回测中提升 0.65 bps,按管理规模百亿美元计,每年可节省数百万美元的执行成本。同时模块化设计降低新市场适配成本,无需策略师重新建模,加速上线周期。

与现有工作流集成

PACE 可作为插件模块挂载到现有 OMS/EMS 系统:接收母订单参数,调用市场 Level-1 数据流(价格、成交量等),通过 LLM 推理输出实时子订单计划。若对延迟敏感,可部署本地化小模型或使用缓存机制;若追求精度,可异步调用云端大模型。与现有风控、合规模块兼容,只需标准化订单指令接口,无需重构整体系统。

具体落地案例

  • 全球量化对冲基金:在美股开盘竞价阶段,用 PACE 替代传统 TWAP 算法执行大额调仓,降低冲击成本并避免暴露交易意图。
  • 加密货币交易所:为高端客户提供“LLM 智能拆分”功能,根据链上数据与 orderbook 变化动态调整下单节奏,提升流动性吸引力。

局限

  • - **数据泛化性不足**:实验仅基于深圳证券交易所 Level-1 数据,包含最优买卖价与成交量,未使用 Level-2 订单簿深度或更高频数据。不同市场(如美股、加密货币)在微观结构、流动性与参与者行为上差异显著,该方法在其它市场或极端行情下的表现尚未验证,泛化能力存疑。
  • - **推理延迟与成本**:PACE 以 LLM 作为规划器,每次决策需完整前向传播,推理延迟可能高达秒级,难以适配高频或低延迟交易场景。论文未讨论在真实交易系统中,计算成本、API 调用频率与决策时效性之间的权衡,实际部署可行性待评估。
  • - **潜在信息泄露风险**:尽管框架无需任务特定训练,但所用 LLM 在大规模预训练时可能已接触过回测期内的金融文本或价格趋势,导致测试集与训练知识重叠,高估模型表现。论文未详细分析预训练数据截止时间与回测期的隔离,可能影响结论的可靠性。
论文Zane Shen2026-07-30原文

相关内容