作者认为自主改进的Harness和面向评分的优化价值有限,不优于Claude Code和Codex。
1. 自主改进的 Harness 不是自进化模型,价值有限
2. 面向评分的优化价值有限,到现实场景不会比 Claude Code 和 Codex 这样的更好
2. 面向评分的优化价值有限,到现实场景不会比 Claude Code 和 Codex 这样的更好
Prime Agent 一个能自主改进的递归 Agent 框架:
仅仅把外面的框架(Harness )换成 Prime Agent
Opus 5 的 ARC-AGI-3 评分从 30.2% 冲到 95.5%甚至超越了人类专家基线(95.4%)
可以直接当 Claude Code、Codex 的替代品
它证明了一件事:AI