论文

EdgeBench: 从真实世界环境中学习的缩放定律揭示

EdgeBench: 从真实世界环境中学习的缩放定律揭示

预训练缩放定律表明,模型能力随数据与计算量可预测地提升。但部署后从真实世界环境中学习的过程仍远未得到充分理解。通过分析 134 个真实世界任务中约 38,000 小时的智能体与环境交互数据,我们首次发现(据我们所知)环境学习中的整体性能遵循 log-sigmoid 缩放定律,其拟合精度极高(R² = 0.998)。 跨模型代际比较进一步显示,智能体的学习速度大约每三个月翻一番。这一发现源于 EdgeBench——一个包含 134 个超长周期真实世界任务的套件,覆盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互游戏等领域。每个任务均需智能体持续运行至少 12 小时,并接受丰富的多层级反馈,且经由大量专家努力构建。 我们公开发布其中 51 个任务及完整评估框架,以促进对智能体如何从真实世界经验中学习的研究。

论文精读

TL;DR 通过分析 38,000 小时代理在 134 个真实任务上的交互,首次揭示环境学习遵循 log-sigmoid 尺度律(R²=0.998),且学习速度每三个月翻倍。

问题

问题背景

当前 AI 领域已从静态预训练转向关注 agent 在部署后从真实环境持续学习 的能力,因为这直接关系到 AI 系统的自主性、泛化性与实际效用。预训练阶段的缩放定律(如 Chinchilla 定律)虽已成熟,但对 agent 在开放世界中的在线学习动力学仍知之甚少。

现有方法局限

  • 基准场景过于简化:现有评测多围绕短周期、单轮任务(如问答、代码补全),缺乏超长周期交互(>12 小时)和多层次反馈(如环境奖惩、自我纠错),无法复现真实世界中的持续性学习。
  • 仿真环境与真实场景脱节:基于合成仿真(如 WebShop、ALFWorld)的 benchmark 难以刻画真实环境的复杂性、噪声和动态分布漂移,导致得到的规律难以迁移。
  • 理论模型缺失:以往研究仅推测 agent 能力随经验增长,但未从大规模数据中定量拟合出普适的缩放函数,无法指导 agent 系统的资源调度与版本迭代节奏。

为什么这个问题难/重要

技术挑战在于:真实环境状态空间极大、反馈稀疏且延迟,单个任务就需数小时交互,要积累足够统计意义的交互数据(如 38,000 小时)需跨任务、跨模型代际的长期协作,成本高昂。

业界关注点:若能揭示 agent 学习速度的规律(例如学习速度约每三个月翻倍),则可类比摩尔定律帮助预测 AI 系统的能力边界,为决策者提供技术迭代的量化参考。该工作首次发现的 log-sigmoid 缩放定律 以 R²=0.998 的高精度拟合全局性能增长,证明环境学习并非不可预测,为构建自我改进型 agent 提供了关键理论基石。

行业类比

可类比自动驾驶系统在真实道路里程积累中不断提升安全性——只不过 EdgeBench 将对象换成了跨科学、工程、数学等的通用 agent,量化其从多元真实经验中学习的速度与天花板。

核心洞察

  • 环境学习遵循 log-sigmoid 缩放定律,R²=0.998,首次在真实世界 agent 任务上验证了从预训练到部署后学习的连续缩放规律。与常见的预训练幂律缩放不同,该定律揭示了 agent 在长时间、多层次反馈下性能提升的 S 形饱和曲线,其精度远高于之前基于合成任务或短时程的推测。这一发现为预测 agent 部署后的能力增长提供了定量工具,直接指导算力分配和任务设计。
  • 跨模型代际学习速度约每三个月翻倍,表明基础模型能力的进步正指数级转化为环境学习效率。这一速度远超硬件迭代或常规软件优化,且是在 134 个多样化真实任务上通过 38,000 小时交互验证得出。相比仅关注静态 benchmark 得分的同类工作,该指标反映了 agent 从经验中自我改进的动态能力,对评估模型代际实际价值、规划持续学习系统具有直接工程意义。

方法

输入与任务设计

EdgeBench 收集了 134 个由专家构建的 长时间、多层次反馈 的真实世界任务,涵盖科学发现、软件工程、组合优化、专业知识工作、形式化数学和交互式游戏六大领域,每个任务支持至少 12 小时连续代理操作,并提供丰富的中间状态返回信号。

关键模块

  • 两容器评估架构:由 Judge Server 和外层循环组成,负责管理超长时执行、状态测量与安全保障,确保交互轨迹的完整采集。
  • 交互数据记录:累计约 38,000 小时代理-环境交互,提取各时间窗口内的任务完成度等性能度量。
  • 环境学习形式化:将每个任务抽象为 任务图,代理探索视为图中可达节点 前沿 的逐步扩张。基于图的自相似性假设,推导出对数时间尺度下性能提升的 sigmoid 形态,从而从理论上解释了观测到的 log-sigmoid 缩放定律
  • 曲线拟合与跨模型对比:使用 log-sigmoid 函数对聚合后的性能曲线进行拟合,获得 R² = 0.998 的极高拟合优度;同时对比不同模型代际的曲线,发现 代理学习速度大约每三个月翻倍 的指数增长规律。

输出

环境学习的 log-sigmoid 缩放定律 及其理论推导过程,以及模型代际间 学习速度指数提升 的实证发现。

与仅衡量模型静态能力的传统基准不同,EdgeBench 首次在长时间、真实环境反馈下捕获了代理的 长程学习动力学,并提供了严格的数学解释。

实验

实验设计

EdgeBench 是一个专为研究环境学习 scaling law 而设计的基准套件,包含 134 个真实世界任务,覆盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互游戏六大领域。每个任务均通过专家设计,提供超长 horizon(至少 12 小时连续 agent 运行)和多级反馈机制。实验采用统一评估协议,收集了不同前沿模型(如 GPT、Claude 系列)在环境中的完整交互轨迹,累计约 38,000 小时 的 agent 操作,据此分析性能随环境交互时间的演化规律。

关键发现

  1. 性能遵循 log-sigmoid scaling law:在所有任务上,agent 的整体学习曲线可以用 log-sigmoid 函数 高精度拟合,决定系数达到 R² = 0.998。这一规律表明,环境学习初期呈加速上升,中期近似线性,最后趋于饱和平台。
  2. 学习速度指数增长:跨模型世代对比显示,agent 的学习速度大约每三个月翻一番,说明基础模型能力的提升直接转化为更高效的环境学习。
  3. 环境学习超越重复采样:控制实验证实,agent 通过环境反馈持续学习带来的增益显著高于仅仅重复采样当前模型的最佳输出,验证了真正的环境交互对能力提升不可或缺。

基线对比解读

论文并未直接与某个已有学习 baseline 比较,而是通过 ablation 设计 区分了“有环境交互”与“无环境交互(仅重复采样)”两种情况。结果表明,仅靠重复采样(即使增加尝试次数)性能提升非常有限,很快触及天花板;而加入环境反馈后,性能沿 log-sigmoid 曲线持续攀升,揭示了 真实世界反馈信号对 agent 自我改进的核心作用。这一发现挑战了仅依赖模型内部知识迭代的范式,为构建能够从环境中持续学习的自主 agent 系统提供了定量依据。

行业影响

落地场景

EdgeBench 所揭示的智能体在真实环境中的学习缩放定律,直接推动长周期自主智能体的产品化落地。典型场景包括:

  • 软件开发:AI 编程助手在复杂代码库重构、遗留系统迁移中持续与环境交互,通过多级反馈(编译、测试、代码审查)优化策略。
  • 科学研究自动化:如材料发现、药物筛选的闭环实验设计,智能体连续操作实验设备并根据结果调整下一步。
  • 金融量化:在模拟交易环境中进行超长周期探索,动态适应市场规律,避免过拟合。
  • 游戏 AI 与交互娱乐:生成式智能体在开放世界游戏中长期存活并发展策略。

商业价值

学习速度每三个月翻倍的发现,意味着持续部署的智能体系统将随模型代际更替获得可预期的性能跃升,直接降低长期维护与人工干预成本。

  • 降本:自主处理耗时数小时的复杂任务,减少人工专家介入(如软件工程师调试、科学家手动实验)。
  • 增收:更高效的自动化决策引擎(如量化策略、个性化推荐)直接提升业务指标。
  • 体验提升:产品内 AI 伴侣或助手的长期记忆与技能成长,提供更深度的个性化服务。

与现有产品/工作流的接口

EdgeBench 可作为 MLOps 流程中的持续评估节点,与现有 LLMOps 栈(如 LangChain、AutoGen)集成:

  • 使用公开的 51 个任务和评估框架构建企业内部回归测试集,监控部署后智能体的学习行为。
  • 将 log-sigmoid 曲线作为 性能基准,在 CI/CD 管道中对比不同模型版本在长期任务上的表现。
  • 通过多级反馈协议对接现有监控系统(如 Prometheus + Grafana),实时绘制学习曲线,触发模型替换或重启策略。

具体落地用例

  1. 企业级软件研发助手:集成到 IDE 插件,自动接受跨文件的长期重构任务(如将单体应用拆分为微服务)。助手根据代码仓库状态、测试反馈持续学习,利用 log-sigmoid 曲线预测完成时间与质量。
  2. 自动驾驶仿真验证:在 CARLA 等仿真器中运行数千小时交互,智能体通过环境反馈学习罕见场景应对。EdgeBench 框架量化学习速度,加速感知-规划模型的迭代。

局限

  • **任务覆盖与可扩展性**:尽管 EdgeBench 包含 134 个任务、覆盖多个领域,但其构建依赖大量专家设计,难以低成本扩展到新领域。任务集虽具有长周期和丰富反馈,但并非所有真实世界部署场景都能提供类似的多级反馈,限制了规律的普适性。此外,公开的 51 个任务仅占完整集的一小部分,可能引入选择偏差,影响独立复现和推广。
  • **评估安全性与作弊风险**:评估框架中,代理可能利用反馈通道获取隐藏信息(如将反馈作为 oracle),或通过优化随机上尾、过拟合评估种子等手段提升表面得分;尽管本文讨论了缓解措施,但此类攻击在开放环境学习中难以根除。这可能导致实际学习能力的度量被高估,削弱所发现 scaling law 的可靠性。
论文Deyao Zhu2026-07-06原文

相关内容