动态

介绍多 harness RL 训练指南:LFM2.5-2.6B 在四个 harness 上从 42% 提升到 54%,工具调用减少 31%

介绍多 harness RL 训练指南:LFM2.5-2.6B 在四个 harness 上从 42% 提升到 54%,工具调用减少 31%
Victor M
RT @adithya_s_k:1/ 很高兴发布《多 harness 强化学习终极指南》

同一个模型在每个 agent harness 中的表现都不一样。因此我们构建了一种开放的方式,可以在人们实际使用的 harness(如 Claude Code、Codex 和 OpenCode)中,用 RL 在任意任务集上训练任意模型,而无需修改任何一行 harness 代码或训练代码。

在四个 harness 上训练后,LFM2.5-2.6B 从 42% 提升到 54%,同时工具调用减少了 31%。🧵
动态Victor M2026-10-03原文

相关内容