基元律动开源 NeoHorse-1,验证 Agent 自我改进闭环
NeoHorse-1 把 Agent 路由日志变成训练数据,让模型从自己的经验中学习,朝 RSI 迈出可复现的一步。
传统 Agent 的执行经验只留在日志里,不进入模型参数。基元律动发布的 NeoHorse-1(4B/9B 开源模型)利用路由系统记录每一步的预测、决策与结果,将其作为训练数据,通过课程学习和路由引导的知识蒸馏让模型少走弯路。这被视作迈向 RSI(递归自我改进,即让 AI 用自身产出迭代下一代)的第一次完整闭环验证。
正文摘录
编辑 | 泽南 Agent 完成任务后,学到的经验去了哪里? 一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。 执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办? 今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。 基元律动最近发布的 NeoHorse-1 试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。 - 论文链接:https://arxiv.org/abs/2609.08183 - HuggingFace:https://huggingface.co/collections/TokenRhythm/neohorse-1 - GitHub:https://github.com/TokenRhythm/NeoHorse 这件事, 被他们称为迈向 RSI 的第一次闭环验证 。 该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。 大模型的终极目标:自我迭代 RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。