GPT-6.1 Sol 在 Codex 中表现远优于 mini-swe Charlie MarshRT @theo:更新后的运行刚刚结束。GPT-6.1 Sol 依然碾压。结果发现它在 Codex 中的表现远好于 mini-swe(即 Artificial Analysis 所用的那个) 动态Charlie Marsh2026-09-30原文 打开互动版