NeoHorse-1: 通过带 Routing Harness 的 Agentic 后训练迈向递归自我改进
递归自我改进(RSI)需要一个具体机制,让 AI 系统能够观察自身能力,并把由此获得的证据转化为下一轮学习。我们提出 NeoHorse-1,一族 agent-native 模型,通过 agentic post-training 探索这条路径。 系统把 异构模型池 与 智能路由 结合,记录每一轮用户交互中预测的能力需求、所选服务层级以及随后的交互内容。这些记录被转换为训练样本,保留交错的推理、工具调用与 harness 上下文,并经由结构校验、六维语义评估与子场景级标注进行准入。路由信号将 监督微调(SFT)组织为三阶段课程,并进一步扩展为 routing-guided on-policy distillation,由教师在同一进度下监督学生生成的回答。Capability-guided allocation 则把评估反馈转化为下一轮的训练混合配比,闭合「评估—选择—更新」循环:系统学会做什么,决定了它接下来从什么中学习。 在覆盖 harness-based agents、工具使用、代码与指令遵循的 11 个 benchmark 上,后训练将 macro-average 从 58.94 提升至 64.87(4B),从 65.60 提升至 69.04(9B),显著缩小了后训练 4B 模型与 9B base 模型之间的总体差距。NeoHorse-1 为这一反馈驱动过程提供了初步原型,也给出了通往跨轮次 harness-mediated RSI 的路径。
论文精读
TL;DR NeoHorse-1 将部署中的智能路由记录转化为训练信号,以路由引导课程与蒸馏闭环不断自我提升,为递归自我改进提供可运行原型,4B/9B 基准分别提升 5.9/3.4 分。
问题
问题背景
当前 agent-native 模型后训练领域正关注递归自我改进 (RSI)——如何让模型从自身部署轨迹中提取反馈,闭环优化能力。
现有方法局限
- 传统 agentic post-training 依赖静态指令集或人工构造任务,缺乏对真实使用中能力边界的感知,训练分布与部署分布脱节。
- 路由系统通常只做请求分发,不记录或利用交互轨迹,造成宝贵信号浪费。
- 课程学习常使用固定难度序列或启发式,无法根据模型表现动态调整。
- 缺少端到端的 评估-选择-更新 闭环,模型难以持续改进。
为什么这个问题难/重要
RSI 需要一个具体机制:观察模型能力并转化为下一轮训练证据。Agentic 交互会留下推理、工具调用、harness 上下文等丰富轨迹,但需要经过结构验证、六维语义评估、子场景标注等处理才能被安全采用。同时,路由信号既反映能力需求,又可用于组织课程与蒸馏,但需解决数据去污染与质量控制。业界越来越关注减少人工干预的持续学习路径,这一问题具备长期价值。
行业类比
类似云服务根据请求复杂度和后端能力动态分配资源,并通过日志反馈优化调度策略——NeoHorse-1 将这种反馈回路引入模型训练。
核心洞察
- 将部署路由痕迹转化为训练数据,实现能力缺口驱动的闭环学习。不同于传统依赖人工标注或静态数据集的 agent 训练,NeoHorse-1 从生产环境的路由 harness 中记录每一次用户 turn 的能力需求预测、服务层级选择与后续交互轨迹,经结构验证与六维语义评估后构建训练样本。这种数据源自系统自身判断与执行结果,能够自动聚焦真实部署中的薄弱场景,形成“评估-选择-更新”的递归循环,为自我改进提供了可工程化的数据引擎。
- 路由信号同时充当课程调度器与蒸馏指导,把能力需求预测显式对齐到训练阶段。论文利用路由评分将 SFT 组织为三阶段课程,并在 on-policy 蒸馏中以相同进度约束师生生成,使模型逐步从低到高能力需求场景学习。与通常按固定难度或随机采样的课程学习相比,该信号直接来自在线服务中的真实难度分布与失败案例,其动态性使训练重点随模型能力演化而调整,避免了静态课程与实际能力不匹配的问题。
方法
输入与闭环设计
NeoHorse-1 的输入是 部署环境中的用户 turn,由 异构模型池 + 智能路由 组成的 routing harness 在每轮交互中记录三类信号:预测的 capability demand、选择的服务 tier、以及 后续完整交互轨迹。这些记录被转换为保留 interleaved reasoning / tool calls / harness context 的训练样本,并通过 结构验证、六维语义评估 和 subscene-level labeling 做质量过滤。
关键训练模块
- Routing-guided curriculum SFT:利用路由分数估计样本难度,将监督微调组织为三阶段课程,由易到难逐步注入能力需求。
- Routing-guided on-policy distillation:教师模型在同一课程进度下监督学生模型生成的响应,蒸馏目标约束学生生成与教师分布一致,同时保持 routing 条件。
- Capability-guided allocation:评估反馈被映射为下一轮训练混合的权重,形成 evaluation → selection → update 的循环,使模型学到的能力影响后续采样。
输出
产出 4B 和 9B 两档 agent-native 模型。论文报告宏平均指标从 58.94 → 64.87(4B),65.60 → 69.04(9B)。
与同类方法的差异:多数 agentic post-training 依赖静态公开数据与固定课程,而 NeoHorse-1 从实际 routing harness 的在线轨迹中提取监督,把服务路由本身当作难度先验,实现数据生成与能力评估的闭环。
实验
实验设计
NeoHorse-1 采用 routing harness 记录每个用户 turn 的 能力需求预测、服务层级选择 与后续交互轨迹,构建训练数据。数据经过 结构验证、六维语义评估 与 子场景标签 后,按路由信号组织为三阶段课程进行 SFT;随后引入 routing-guided on-policy distillation,在相同阶段递进下由 teacher 监督 student 生成。最后通过 capability-guided allocation 将评测反馈转化为下一轮训练配比,形成闭环。
关键发现
在 11 个覆盖 agent、工具调用、代码与指令遵循的基准上,post-training 后 4B 模型宏平均从 58.94 提升到 64.87(+5.93),9B 模型从 65.60 提升到 69.04(+3.44)。值得注意的是,post-trained 4B 模型与 9B base 模型之间的聚合差距大幅缩小,证明该流程能让较小模型逼近更大模型的初始能力。
基线对比解读
相比直接 SFT,本工作利用路由信号和在线蒸馏,更贴近真实部署的 agentic 场景。4B 提升幅度高于 9B,显示在反馈循环下小模型有更大增益空间;同时 9B 的绝对分数仍领先,说明规模仍具优势。该框架为后续迭代提供可复用的数据飞轮。
行业影响
落地场景
NeoHorse-1 的 routing harness 与 agentic post-training 管线可直接嵌入需要多层级智能体服务的平台。典型场景包括:
- 企业服务:智能工单系统、自动化客服助手,根据用户请求复杂度动态选择 4B 或 9B 模型,简单查询走小模型,复杂多步推理走大模型。
- 内容平台:自动化内容审核与生成,通过 tool calls 与 harness context 保留的交互轨迹持续优化模型对长尾场景的覆盖。
- 电商:智能导购与售后 agent,利用 routing signals 识别用户意图难度,调用不同能力模型,同时把失败案例回流为下一轮训练数据。
商业价值
核心收益来自 降本 与 体验提升 两条线:
- 降本:异构模型池 + 智能路由将大部分简单流量导向 4B 小模型,仅在需要时升级到 9B,推理成本显著低于全量使用大模型。论文显示 4B 后训练模型在 11 个基准上从 58.94 提升至 64.87,逼近 9B 基座,意味着更小模型可承担更多任务。
- 体验提升:routing-guided on-policy distillation 与 capability-guided allocation 形成从评估反馈到训练混合物更新的闭环,模型错误率下降,工具调用和指令跟随更稳定,用户任务完成率提升。
- 增收:更可靠的 agent 可承担高价值自动流程,减少人工介入,提高转化率。
与现有产品/工作流的接口
集成路径清晰:
- 将 NeoHorse-1 作为模型池接入现有 LLM 推理服务(如 vLLM、TGI),路由层作为独立组件部署在网关侧,记录每次调用的
capability demand、service tier、interaction字段。 - 离线训练阶段使用 routing-guided curriculum 对模型做 SFT 和蒸馏,与现有 MLOps 平台(如 MLflow、Kubeflow)打通,定期用新路由日志增量更新模型。
- 对于已经在使用 LangChain、AutoGen 等 agent 框架的团队,可将路由信号作为上下文传入提示词,指导 agent 规划与工具选择,同时将最终轨迹写回数据湖用于下一步训练。
该方案的价值在于:不推翻现有推理架构,而是通过增加一个可观测、可训练的路由层,把生产流量转化为持续改进模型的原料,对已部署多模型服务的团队尤其有吸引力。
局限
- 实验规模与泛化性局限:论文仅在 4B 和 9B 参数模型上进行验证,未涉及更大规模(如 70B)或不同架构的模型。训练数据全部来源于自建 routing harness 的部署日志,数据分布可能受限于该系统的用户群体和任务类型(偏向工具调用和编码),导致模型在更广泛 agent 场景(如开放域对话、复杂规划)上的泛化能力未得到验证。此外,能力引导的分配策略仅在单次迭代中展示,尚未通过多轮 RSI 循环证明其长期有效性。
- 数据质量与标注成本:数据筛选依赖结构验证、六维语义评估和子场景级别标注,这些流程可能高度依赖人工专家或复杂的自动评分器,论文未报告标注成本、一致性和可扩展性。在大规模部署中,log 数据量巨大,高质量标注的瓶颈可能限制 RSI 循环的迭代速度。与使用纯合成数据或弱监督的方法相比,NeoHorse-1 对标注质量的要求更高,可能影响其实际部署效率。
- 评估基准与对比不足:论文在 11 个基准上报告了提升,但基准选择偏向 harness-based agents、工具使用和编码,对多轮对话、长期记忆、多智能体协作等能力覆盖不足。此外,缺少与当前领先的 agentic 模型(如 GPT-4 系列、Claude 等)的直接对比,仅展示了基础模型与后训练模型之间的差异,难以定位其在行业中的实际水平。与一些开源 agent 框架(如 OpenHands、AutoGen)的对比也未涉及,限制了结论的普适性。