作者预测Agent性能,认为2026年9月可达40-50%
很高兴看到PostTrainBench出现在@jackclarkSF的通讯里!
关于到2026年9月超越人类基线的豪言壮语,不过:-) 还有很多改进空间:
- 定制CLI agent的脚手架,而不是直接使用Claude Code / Codex CLI。
- 给agent配备超过1个GPU和10小时也会有很大帮助。
- 在系统提示中提供有前景的实现策略(目前PostTrainBench不支持,但有助于给出agent性能的上限)。
- 底层LLM也会持续改进。
但是,我更看好到9月时达到50%左右,而不是62%(人类基线)。从10%提升到40-50%只需要实施SFT、搞懂聊天模板以及一般的CLI/编码能力。从50%到60%会更难,因为需要agent学会:
1. 找到最佳的开源方案(例如s1论文 https://arxiv.org/abs/2501.19393 或OpenThoughts https://arxiv.org/abs/2506.04178),
2. 利用现有数据或生成足量的高质量合成数据,
3. 在合理时间内完成。
但无论如何,人类基线并不是天花板:-) 完全可以超越,所以PostTrainBench即使超过人类基线后仍将保持其相关性。此外,我们已经在规划更难的版本,因为原始基准套件(AIME 2025, BFCL, GPQA, GSM8K, HumanEval)整体相对简单。
https://importai.substack.com/p/import-ai-439-ai-kernels-decentralized…
关于到2026年9月超越人类基线的豪言壮语,不过:-) 还有很多改进空间:
- 定制CLI agent的脚手架,而不是直接使用Claude Code / Codex CLI。
- 给agent配备超过1个GPU和10小时也会有很大帮助。
- 在系统提示中提供有前景的实现策略(目前PostTrainBench不支持,但有助于给出agent性能的上限)。
- 底层LLM也会持续改进。
但是,我更看好到9月时达到50%左右,而不是62%(人类基线)。从10%提升到40-50%只需要实施SFT、搞懂聊天模板以及一般的CLI/编码能力。从50%到60%会更难,因为需要agent学会:
1. 找到最佳的开源方案(例如s1论文 https://arxiv.org/abs/2501.19393 或OpenThoughts https://arxiv.org/abs/2506.04178),
2. 利用现有数据或生成足量的高质量合成数据,
3. 在合理时间内完成。
但无论如何,人类基线并不是天花板:-) 完全可以超越,所以PostTrainBench即使超过人类基线后仍将保持其相关性。此外,我们已经在规划更难的版本,因为原始基准套件(AIME 2025, BFCL, GPQA, GSM8K, HumanEval)整体相对简单。
https://importai.substack.com/p/import-ai-439-ai-kernels-decentralized…