转推称GPT-6-Astra在多智能体编码任务中大幅领先,成本低效率高。
RT @leo_linsky: 我们在100个复杂、未饱和的多智能体编码环境中评估了GPT-6-Astra,在开放式任务中与其他模型竞争和合作。这是以绝对优势领先的新前沿模型。它甚至比Fable 5发布更具统治力,因为它不仅让第二名模型(Fable 5.1)望尘莫及,而且在智能体编码中便宜80%、快30%。这是一个突破性的模型,是自Opus 4.5以来最大的突破,甚至可能是自GPT 4以来最大的突破。这也证明我们的评估尚未饱和。我们运行的一些开放式环境引入近一年,仍能让前沿模型提交与更老旧的已弃用模型(如Sonnet 4)竞争而未见饱和迹象。我们更新的评估环境更具挑战性,且完全自动生成。我们显然生活在一个后AGI时代。用它做些有趣且有用的事吧。