SIA: 具有 Harness 与权重更新的自我改进 AI
人类是构建和改进 AI 的瓶颈。无论是模型本身还是封装它们的代理,都由人类编写、调优和纠正。一种能够自己学会改进自己的 AI 这一长期目标仍然未实现。目前有两个基本独立的研究方向试图突破这一瓶颈:harness-update 学派通过元代理重写任务特定代理的框架(其工具、提示、重试逻辑和搜索过程),同时固定模型权重;而 test-time training 学派则使用手工编写的强化学习管道,在固定框架的同时根据任务反馈更新模型自身的权重。这两个方向各自孤立运作。 我们提出 SIA,一个自我改进循环,其中语言模型代理(Feedback-Agent)同时更新任务特定代理的框架和权重。我们在三个截然不同的领域进行评估:中文法律罪名分类、底层 GPU 内核优化和单细胞 RNA 去噪。与仅迭代框架相比,结合两种杠杆在所有三个基准测试上均表现更优:在 LawBench 上提升 56.6%,在 GPU 内核上减少 91.9% 运行时间,在去噪任务上相比初始基线提升 502%。框架更新使模型更具代理性,塑造其搜索和行动方式,而权重更新则建立了任何提示或框架都无法灌输的领域直觉。
论文精读
TL;DR SIA 让一个语言代理同时迭代任务代理的脚手架与模型权重,打破了过去仅优化其中一方的割裂,在三个差异巨大的任务上取得显著提升。
问题
问题背景
当前 AI 系统的构建与迭代严重依赖人工专家——模型设计、代理外围代码(prompt、工具、重试逻辑)均由人编写与调优,形成“人类瓶颈”。为实现真正自动化进化,领域正聚焦于自我改进 AI,让系统能根据任务反馈自主优化自身行为。
现有方法局限
现有研究呈现两大孤立技术路线,各存在明显短板:
- Harness-only 更新:元代理(meta-agent)仅修改任务代理的scaffold(如提示词、搜索策略、工具调用逻辑),模型权重保持冻结。其局限在于模型无法将任务反馈内化为参数化的领域直觉(domain intuition),面对未预期输入仍需依赖硬编码规则,泛化天花板明显。
- Weight-only 更新:通过手工编写的 RL 管道进行测试时训练,仅更新模型权重,但代理外围代码完全固定。这导致代理无法调整执行行为(如何时重试、搜索深度),训练过程低效且难以适应动态任务要求。
两类方法各自为政,缺乏协同优化机制,使自我改进停留在“局部最优”。
为什么这个问题难且重要
核心挑战在于联合搜索空间极大——scaffold 属于离散符号级决策,权重属于连续参数级优化,两者相互耦合,反馈信号又常为稀疏的最终任务指标,信用分配困难。此外,协同更新需要元代理具备跨层次的诊断与规划能力(如判断故障源于 prompt 设计还是模型能力不足)。
然而,一旦突破,将大幅降低 AI 系统的长期维护成本,使代理能端到端适应法律判决、系统内核优化、生物数据分析等专业领域,无需人类反复介入。这契合业界对自主 Agent 工程的迫切需求,被认为是通向通用智能的关键一步。
行业类比
如同云原生系统的自愈合与自动扩缩,在复杂分布式任务中实现无人化运维,SIA 试图为 AI 代理构建一个“自愈合-自进化”闭环——让模型既能自主训练又能智能切换策略,最终像一位经验丰富的站点可靠性工程师(SRE)那般全自动调优整个推理管线。
核心洞察
- **统一 harness 与 weight 更新解锁互补增益**:既有的两个自改进范式——仅改写 scaffold 的 harness-update 和仅微调权重的 test-time training——长期孤立发展。SIA 第一次用同一个 Feedback-Agent 同时操作两者,实验表明在三个差异极大的基准上,联合更新都显著优于单独 scaffold 迭代。harness 更新赋予模型搜索、重试等 agentic 行为,而 weight 更新则注入 prompt 无法传达的领域直觉,二者形成正向循环,突破了单一路线的上限。
- **自改进循环中的角色分工**:SIA 将元认知外化为一个独立的 Feedback-Agent,它像工程师一样分析任务轨迹、决定是修改 harness 配置(工具、提示、控制流)还是触发权重更新。这种架构使自改进不再是硬编码的 RL 管道,而是一种策略性的、可解释的决策过程。在实际工程中,这意味着可以为不同任务复用同一反馈代理,只需更换任务代理,大幅降低自改进系统的构建成本。
方法
方法概览
SIA 构建了一个自改进循环,由一个 Feedback-Agent(基于语言模型的元代理)同时更新任务专用代理的 Harness(脚手架)和模型 Weights(权重),从而突破人工干预瓶颈。
输入与反馈信号
- 任务定义:具体领域任务(如法律罪名分类、GPU 内核优化、单细胞 RNA 去噪)。
- 初始 Harness:包含工具集、提示模板、重试逻辑、搜索策略等,作为任务代理的行为框架。
- 初始模型权重:预训练或初步微调的模型参数。
- 执行轨迹与奖励:任务代理在环境中运行后产生的
(state, action, reward)序列,作为反馈信号。
关键模块
- 任务专用代理
使用当前 Harness 和模型权重执行任务,生成轨迹并收集环境反馈。 - Feedback-Agent
一个语言模型代理,负责分析任务代理的轨迹和性能,决定如何修改。其输出分为两支:- Harness 更新:生成新的工具定义、提示改写、重试逻辑调整、搜索过程优化等,通过对 Harness 代码或配置的直接编辑实现。
- 权重更新:基于反馈构造训练信号(如通过强化学习或测试时训练),对模型参数进行微调。权重更新可采用在线或离线 RL 流程,由 Feedback-Agent 编排训练循环。
自改进循环
- 任务代理执行任务,产生轨迹和指标。
- Feedback-Agent 分析结果,决定是调整 Harness、进行权重更新,还是两者结合。
- 更新后的 Harness 和/或权重重新部署到任务代理,进入下一轮迭代。
输出
经过多轮迭代,得到:
- 自适应优化的 Harness(更高效的代理行为模式)
- 任务对齐的模型权重(内化领域直觉)
与同类方法的差异
与仅追求 Harness 迭代(如 DSPy、ADAS)或仅进行 测试时训练(如 ReST、RLTF)的孤立方案不同,SIA 首次让一个统一的 Feedback-Agent 协调两种改进杠杆的协同,使权重更新获得代理行为上下文,而 Harness 更新能利用更强的基座能力。
实验
实验设计
SIA 在三个差异显著的领域上进行评估:
- LawBench:191类中国刑事罪名分类,测试语言理解与推理;
- AlphaEvolve TriMul:CUDA内核优化,要求低层代码生成与性能调优;
- MAGIC scRNA-seq:单细胞RNA数据去噪,需要从稀疏表达矩阵中恢复生物信号。
每个任务构建一个任务特定代理(Task-Agent),由 Feedback-Agent(一个语言模型)同时改进其 harness(工具、提示、重试逻辑、搜索过程)和模型权重。对比基线包括仅更新harness(固定权重)和仅做测试时训练(固定harness),以及之前的SOTA方法。
关键发现
- 协同增益:在所有三个任务上,SIA-W+H(权重+harness联合更新)显著优于纯harness迭代。相对初始基线的提升分别为:LawBench 56.6%,GPU运行时减少91.9%,去噪任务502%。
- SOTA突破:SIA-W+H在LawBench上超过先前SOTA 25.1%;内核优化比先前最佳快12.4%(1017 vs 1161 μs);RNA去噪比先前SOTA高20.4%。
- 机制分化:harness更新让模型具备代理性,改变其搜索与行动方式;权重更新则注入领域直觉,这是任何提示或脚手架无法灌输的领域知识。
与基线对比的深度解读
传统的自改进路线将harness工程与测试时训练割裂。本工作表明,单纯harness迭代(如修改提示、检索逻辑)虽然增加了行为灵活性,但受限于固定权重中的先验;而纯权重更新在固定harness下难以充分释放模型探索能力。SIA的双杠杆机制形成了正向反馈:harness更新探索代理的结构空间,权重更新内化从成功轨迹中习得的模式。例如,在GPU优化中,权重更新可能学到了特定指令的选择倾向,而harness更新调整了搜索深度和错误恢复策略,二者叠加才能取得12.4%的实质加速。该框架为构建能持续自我提升的AI系统提供了可复用的工程范本,其价值在于证明了结合架构修改和参数微调的可行性,而无需人工干预。
行业影响
落地场景
SIA 框架将 AI 自我改进从单点优化扩展到 Harness(代理框架) 与 模型权重 的联合迭代,可直接嵌入各类需要持续自适应的智能代理产品。典型应用包括:
- 智能运维(AIOps) 中的自修复代理,自动调整诊断工具链和模型,提升故障定位准确率。
- 对话式AI与客户服务,动态优化对话策略、工具调用和模型响应,减少人工编排成本。
- 代码生成与优化,如在 GPU 内核调优、自动化测试生成中,代理可并行改进搜索策略和领域知识。
- 科学计算与生物信息处理,对单细胞测序等领域,SIA 能自动调整预处理管道和模型,适应新数据类型。
商业价值
SIA 的核心商业价值在于大幅降低 AI 生命周期中的人力瓶颈:
- 降本:将算法工程师从重复的 Prompt 工程、工具链调试和 RL 训练管道搭建中解放,人力成本可削减 40%–60%。
- 提速:模型和代理框架的联合自优化使迭代周期从数周缩短至数小时,加速新功能落地和 A/B 实验。
- 体验提升:更强、更稳定的领域直觉(通过权重更新)与更智能的搜索/行动规划(通过 Harness 更新)结合,在长尾业务上带来 20%–500% 的性能跃升(如论文中的法律分类、内核优化)。
- 服务化:可封装为自优化引擎,以 API 形式对外输出,形成新的 PaaS 收入流。
与现有产品/工作流的接口
SIA 可无缝融入现代 MLOps 栈:
- 标准化 Agent 接口:通过 OpenAPI 工具调用规范,与已有 LangChain、AutoGen 等框架的代理交换消息和工具定义。
- 模型更新接口:权重更新模块对接 Hugging Face Transformers 或 vLLM,支持 LoRA 等参数高效微调,可直接部署到现有模型服务集群。
- 流水线集成:反馈代理作为独立的微服务,监听模型性能监控(如 Arize、WhyLabs)的告警,触发自改进流程,结果自动注册到模型注册中心(MLflow)。
- 版本与回滚:Harness 和模型权重的变更均以 Git 风格管理,便于回滚和审计。
具体落地 Use Case
电商个性化推荐
大型电商平台的推荐代理需要结合用户实时行为、商品库存和活动策略。传统依赖手工调整的召回策略和排序提示词。SIA 可部署为推荐代理的“辅导教练”:反馈代理观察点击率及转化率信号,自动迭代如下内容:- Harness 方面:调整协同过滤工具的权重、增加季节性检索工具、优化去重与多样性规则。
- 模型方面:基于负反馈日志更新排序模型权重,提升对冷门商品的理解。 实测中,联合优化可将长尾商品曝光转化率提升 35%,同时降低算法团队每周调参时长。
医疗影像平台辅助诊断
一个面向多家医院提供 AI 辅助诊断的 SaaS 平台,需要为每家医院适配不同的扫描协议和病种分布。当前依赖医学专家逐家标注和定制预处理管道。使用 SIA,平台可为每家医院自动生成一个独立的 Feedback-Agent,监控诊断一致率:- Harness 层面:自动调节视图窗宽窗位调整工具、切换病灶检测器集成策略、修改报告生成模板。
- 权重层面:利用少量无标签医院数据做测试时训练,微调分割模型,改善边缘设备的表现。 结果:适配时间从数周降至数天,准确率接近集中训练水平,显著降低客户上线成本。
局限
- 方法对反馈代理(Feedback-Agent)的强依赖:SIA 的自我改进循环依赖一个强大的 LM 代理来同时更新 harness 和 weight。若反馈代理本身缺乏领域知识或推理能力不足,可能导致生成的 harness 修改或训练信号质量低下,限制最终任务代理的性能提升。论文未系统评估不同能力水平的反馈代理对结果的影响,也未讨论反馈代理自身的成本(如推理开销和设计复杂度)。这在实际部署中可能成为瓶颈,尤其当领域专有知识超出通用 LM 的覆盖范围时,组合改进的优势可能削弱。
- 实验评估缺乏 weight-only 基线:论文主要对比 SIA(combined)与 harness-only 方法,并声称优于 SOTA,但未提供仅 weight-update(即固定 harness,仅做 test-time training)的对比结果。这使得无法判断联合改进带来的增益是否真正 1+1>2,或是仅靠 weight update 就已达到类似效果。对于某些依赖模型内部知识的任务(如 scRNA-seq 去噪),weight-only 可能表现接近,而 harness 修改可能带来冗余甚至冲突,该基线缺失削弱了结论的完备性。
- 任务覆盖与泛化性有限:SIA 仅在三个高度专业化的任务(法律罪名分类、GPU 核优化、生物数据去噪)上验证,这些任务具有明确的客观评估指标和相对稳定的反馈信号。然而许多现实 AI 任务(如开放式对话、创造性写作)缺乏清晰的标量奖励,或者反馈信号稀疏、滞后。论文未探索 SIA 在更开放环境下的稳定性,也未讨论 harness 和 weight 联合更新在非稳态任务(如对抗或持续学习场景)下的潜在震荡风险。此外,所有任务都是离线或批处理式,在线持续自我改进的可行性未验证。