评估显示GPT-6-Astra在多智能体编码中大幅领先,成本更低。
转推 @leo_linsky: 我们在100个复杂、未饱和的多智能体编码环境中评估了GPT-6-Astra,它在开放式任务中与其他模型竞争和合作。它绝对是新的前沿模型,统治力甚至超过Fable 5发布,不仅碾压第二好的模型(Fable 5.1),而且在智能体编码中成本低80%,速度快30%。这是一个开创性的模型,是自Opus 4.5以来最大的突破,甚至可能超越GPT 4。这也证明了我们的评估尚未饱和。我们运行的一些开放式环境引入近一年,仍能让前沿模型与Sonnet 4等旧模型竞争而不出现饱和迹象。我们更新的环境更具挑战性,且完全自动生成。我们显然生活在一个后AGI世界,用它做些有趣且有用的事吧。