Prime Intellect 让 18 个 AI 智能体自主科研,开源模型 Kimi K3 接近 Opus 5
18 个 AI 智能体自主做科研实验,开源模型借助 Harness 跑出接近顶尖闭源模型的成绩,说明“AI 开发 AI”的可行性。
Prime Intellect 用多智能体框架 Harness 让 18 个前沿大模型自主完成 nanoGPT 优化任务。全程无人干预,开源模型 Kimi K3 借助 Harness 跑出 2930 步,超过 GPT-5.6 Sol 的 3042 步,仅比 Opus 5 的 2920 步多 10 步。结果显示,开源模型加编排框架已能逼近顶尖闭源模型。
正文摘录
借助 多智能体 Harness(Agent 编排框架),可以把监控和具体实现交给更小、更便宜的开源模型,从而让“AI 开发 AI”变得更便宜,甚至效果更好。 在实验中,他们把 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3 等 18 个前沿模型,扔进了一场 nanoGPT 优化器速通。 结果,开源权重模型 Kimi K3 搭配 Prime Agent Harness 后,在原始结果页中跑出了 2930 步的成绩。 这不仅超过了 GPT-5.6 Sol 的 3042 步,距离 Claude 的旗舰模型 Opus 5 的 2920 步也只差 10 步。 换句话说,在 AI 研究这件事上,一套由开源模型和 Harness 组成的系统,已经能够超过部分顶级闭源模型,甚至逼近第一梯队。 某个最强闭源模型率先跨过“AI 开发 AI”的临界点,然后不断自我迭代,把其他玩家越甩越远,最终赢家通吃。 模型不一定非得最强,只要底下这套科研机器足够高效,开源模型同样可以靠更高的试错吞吐量追上来。 而这,也进一步展示了 Harness 这类 Agent 编排框架在 AI4AI、AutoResearch 上的潜力。 简单来说,这次 Prime Intellect 的实验,就是让十几个前沿大模型,去速通 Karpathy 那套著名的 nanoGPT 训练任务。 Prime Intellect 做的,是直接把 AI 扔进一个目标明确、反馈快速的真实训练任务里,看它能不能像人类研究员一样,不断提出假设、跑实验、看结果,再继续往下改。 Agent 一开始会拿到一份带有 baseline(基线)超参数的训练脚本,同时只得到一个提示:现在这套方案还不够好。