论文

Aspire: 模型能否从模糊目标中自我进化?

Aspire: 模型能否从模糊目标中自我进化?

许多重要的人类学习形式始于一个模糊目标,例如“成为更好的物理学家”或“提高研究能力”。学习者必须解读目标、识别能力差距、决定如何学习,并判断自己是否真正进步。相比之下,现有关于 LLM 自我进化的研究通常以人类指定的任务和评估指标为起点,将自我进化简化为优化显式目标,而不是决定学什么和怎么学。我们提出 ASPIRE,一个面向模糊目标驱动自我进化的基准。 ASPIRE 仅提供自然语言能力目标,而下游评估任务保持隐藏。智能体必须通过选择数据和更新方法来操作化目标,构建训练与验证信号,并决定何时评估。ASPIRE 在统一交互环境中支持模型权重进化和智能体框架进化,并在隐藏的、专家撰写的 520 个样本上评估最终系统,涵盖六个目标。实验表明,模糊目标将搜索努力转向目标解读。当前智能体常能完成训练和框架编辑循环,但权重层面的提升稀少而不稳定,最强进化框架仍低于工程化的 Qwen-Agent 参考。智能体常在数据不匹配时训练,并信任狭窄的自我评估,导致局部增益无法迁移到隐藏评估,持续搜索与训练可能抹去早期改进。

论文精读

TL;DR ASPIRE 基准让 LLM 仅凭模糊能力目标自我进化,隐藏下游评估任务,首次系统揭示目标解读、数据选择与权重级增益不稳定等根本挑战。

问题

问题背景

当前 LLM self-evolution 研究多聚焦于在人类预设的任务与指标上优化模型,但真实学习常始于模糊目标,如“提升物理研究能力”。

现有方法局限

现有工作将 self-evolution 简化为对显式目标的优化:任务、评估数据与指标均由人类预先指定,agent 只需执行训练循环,缺少对目标解读、能力差距识别、学习内容决策的自主性。这导致进化方向单一,容易过拟合特定基准,且无法迁移到未见任务。

为什么这个问题难且重要

模糊目标驱动的自进化要求 agent 从自然语言目标出发,自行选择训练数据、构建验证信号、决定更新方法与评估时机;同时 ASPIRE 基准隐藏了评估集,避免指标泄漏,但 agent 必须在无外部反馈的情况下判断自身是否真正提升。实验表明,当前 agent 常选择不匹配数据、信任狭窄自评估,导致局部增益无法迁移到隐藏评估,甚至持续搜索会擦除早期改进。这一挑战关系到通用 agent 能否在开放环境中持续自我改进。

行业类比

类似要求一个通用 agent 在缺乏明确 KPI 的产品迭代中,仅凭“提升用户体验”这一模糊指示,自主拆解并落地可验证的能力提升。

核心洞察

  • 模糊目标驱动的自进化迫使模型将“目标解释”作为首要的搜索维度,而非仅优化下游任务性能。现有 self-training 或 automated post-training 基准通常由人类给定任务和评估指标,模型只需优化显式目标;ASPIRE 只提供自然语言能力目标并隐藏下游评估,因此模型必须自主决定学什么、如何构建训练/验证信号、何时评估。这使自进化从“优化问题”转变为“学习规划问题”,揭示了目标解释与数据选择之间的耦合,是区别于同类工作的核心创新。
  • 模型权重级自进化目前存在“伪进展”风险:训练循环可完成,但能力增益稀少且不稳定,持续搜索甚至可能消除早期改进。实验显示 agent 能完成训练和 harness-editing 循环,但仅个别配置的均值超过基座分数;模型常训练在不匹配的数据上,信任狭窄的自评估信号,导致局部增益无法迁移到隐藏评估。这与许多专注于方法改进的工作不同,ASPIRE 通过隐藏评估和查询限制协议暴露了评估设计与搜索轨迹对真实能力留存的关键作用,为后续自进化系统提供了必须警惕的失败模式。

方法

ASPIRE 方法框架

输入:一个自然语言写的能力目标(例如“提升物理研究能力”),不提供任何下游任务定义、指标或训练数据。评估集完全隐藏,仅保留一个查询受限的接口用于最终评测。

关键模块:

  1. Campaign 与 Round 结构:整个自进化过程被组织为多轮 campaign,每轮 agent 可以执行训练、评估、修改 harness 等动作,然后根据反馈决定下一步。
  2. 双进化表面:
    • 模型权重进化:agent 自主选择数据、训练配置(如 SFT 或 LoRA),生成候选权重,并通过自建验证信号判断是否保留。
    • Agent harness 进化:agent 可以修改自身的工具调用逻辑、工作流或提示模板,形成新的 harness 版本。
  3. 最小交互环境与安全保留:提供 agent 可执行的工具,但所有候选产出(权重或 harness)必须经过验证与审计才能生效。环境施加信任边界,防止不可信操作污染后续流程。
  4. 隐藏评测与 query 限制:最终评估集由专家编写,包含 520 个条目、覆盖六个目标。agent 不能直接访问该集,只能通过有限次查询获得分数信号,避免过拟合。

输出:进化后的模型权重和/或 agent harness,在隐藏评估集上的能力得分。

差异点:与现有 self-evolution 工作相比,ASPIRE 将“学什么”和“怎么学”的决策完全交给 agent,而非提供显式任务和指标,从而暴露目标解释、数据选择和自评估偏差等真实挑战。

实验

实验设计

ASPIRE 提供六个模糊能力目标(如“成为更好的物理学家”),下游评估任务隐藏,仅提供自然语言目标。代理必须自主选择数据、更新方法、构建训练/验证信号并决定何时评估。环境支持两类进化表面:模型权重更新与 agent harness 编辑。最终在隐藏的专家编写 520 项测试集上评估,覆盖六个目标。实验设置三个研究问题:RQ1 比较显式任务与模糊目标的后训练差异;RQ2 测试从指令微调检查点自指导权重更新能否获得能力增益;RQ3 探索 harness 进化。

关键发现

  • 模糊目标使搜索努力转向目标解释,最终分数整体低于显式任务设置,且任务级变化不一。
  • 权重进化收益稀疏且不稳定:仅有一个两次运行均值超过基线的案例;训练出 checkpoint 常见,但超越基线罕见。
  • 常见失败模式:代理训练错配数据、信任狭窄自我评估,本地增益无法迁移到隐藏评估,且持续搜索/训练会抹去早期改进;数字标签 SFT 导致答案格式崩溃。
  • harness 进化中,最强后继 harness 数值上仍低于工程化 Qwen-Agent 参考,窄验证会特化到错误代理,答案审查不保证输出完整性。

与基线对比

与显式任务后训练对比,ASPIRE 的模糊目标导致资源使用模式不同,代理更倾向于目标解释而非直接优化指标。与人工设计的 Qwen-Agent 参考对比,自动进化的 harness 落后,说明当前自进化机制尚不能替代工程化组件。权重级进化相比固定基点增益有限,反映出从模糊目标到可靠能力提升的路径仍不清晰,需要更强的目标操作化与验证机制。

行业影响

落地场景

ASPIRE 揭示的 vague-goal-driven self-evolution 直接指向需要 自主能力提升 的产品:

  • AI 客服 / 对话式助手:以“提高用户问题解决率”为模糊目标,agent 自行调整回答策略、检索知识库或微调权重。
  • 个性化推荐 / 内容平台:目标如“提升长期留存”,agent 尝试更新排序特征或探索新的召回路径。
  • 企业级自动化流程(RPA + LLM):agent 以“缩短流程耗时”为目标,自主修改工具调用逻辑或 prompt 模板。
  • 教育 / 企业培训自适应系统:以“提高学员知识掌握度”为引导,动态调整教学内容与难度。

商业价值

核心价值在于 降低持续人工调优成本 与 缩短迭代周期:

  • 现有 LLM 自进化依赖明确任务指标,人工定义成本高且难以覆盖真实场景的模糊需求;ASPIRE 框架若能落地,可让 agent 从业务目标出发自我探索改进路径。
  • 论文结果表明当前系统在权重级进化上不稳定,但 harness 级(工具编排、prompt 策略) 已能产生部分有效改进,说明短期内可通过 agent 工作流自我优化获得增益,适合以 SaaS 或内部 MLOps 工具 形式输出。
  • 长期看,可靠的模糊目标进化能力将带来 体验提升(更智能的助手)和 增收(个性化服务提升转化),但需先解决“错误自我评估导致退化”的问题。

与现有产品/工作流的接口

ASPIRE 可作为 评估与实验基准 集成进现有 AI 研发链路:

  1. 模型训练阶段:将 ASPIRE 隐藏评估集作为模型上线前的泛化能力测试,特别是针对 agent 系统的自主更新能力。
  2. Agent 框架层:在 LangChain、AutoGen 等工具中嵌入 ASPIRE 风格的环境,提供 evolve() 接口,让开发者定义模糊目标并监控自我训练轨迹。
  3. 监控与回滚:参考论文中的 safe retention 和 rollback 机制,在 CI/CD 中加入自动检测点,防止 agent 自我训练导致性能回退。

具体 use case:

  • 电商搜索推荐:agent 以“提升用户点击后购买率”为目标,自主尝试调整排序模型特征权重或 query 理解规则;通过 ASPIRE 风格的隐藏评估集验证改进是否泛化。
  • 医疗问答辅助:agent 以“提高回答的临床准确性”为目标,探索检索增强策略或生成后审核流程;利用隐藏专家标注集评估安全边界。

局限

  • **评估范围与规模有限**:ASPIRE 目前仅覆盖六个能力目标、520 个专家编写的隐藏评估项,且每个 campaign 的隐藏评估查询次数受限。这可能导致评估结果对特定目标或领域敏感,难以推广到更广泛的 AI 能力维度。相比大规模学术基准(如 MMLU、HELM),该基准规模较小,无法充分验证 vague-goal 自演化在不同能力上的稳健性。未来应扩展目标类别、增加评估项数量,并引入更细粒度的能力分级与跨目标泛化分析。
  • **实验设置与模型覆盖不足**:论文实验主要以单个指令微调模型为起点(从 Qwen-Agent 参考可见),未系统探索不同规模、不同预训练家族或不同指令微调策略的影响。此外,允许的权重更新方法(如 SFT、LoRA)和 agent 工具集是预设的最小集合,可能限制 agent 探索更丰富的自演化路径。对比已有自演化工作(如 self-rewarding、self-refine)常使用多种训练信号和更强工具,ASPIRE 的“最小环境”设计可能低估了 agent 的真实自演化潜力。
  • **信息边界与安全约束可能干扰真实自演化行为**:为保障安全保留和可审计性,ASPIRE 采用验证候选和原子操作,这虽然防止了灾难性遗忘和非法修改,但也可能剥夺了 agent 进行高风险探索或更激进权重更新的机会。论文中观察到的“答案格式崩溃”和“训练导致退步”可能部分源于受限环境,而非 agent 自身缺陷。此外,隐藏评估与 agent 自我评估的信号不一致是核心挑战,但作者没有提供机制来校准或纠正这种系统性偏差,限制了结论的因果解释力。
论文Yuhao Wu2026-08-31原文

相关内容