动态

转推 GPT-6 Sol 评测:写作/电脑操作/编程对比 Opus 5.5

Charlie Marsh
转推 @danshipper:突发:

@OpenAI 刚刚发布了 GPT-6 Sol。它成了我在 Codex 里的新日常主力:还比不上 Astra,但对我日常的大部分工作来说已经足够接近,速度更快,而且比 5.6 Sol 便宜 50%。

我们在 @every 实际做的工作上测试了它,并与 Opus 5.5 做了正面比拼。以下是我的主观体验:

• 写作:在一项取自我个人真实工作的段落写作任务中,Sol 的得分接近 Astra,而 Astra 仍是我心中写作最强的模型。它写出的文字干净、简洁,把重点放在最前面。Opus 5.5 用起来很舒服,但它的草稿仍然倾向于把重点埋起来。

• 电脑操作:如果你喜欢 Astra 的 computer use,你也会喜欢 Sol。早期预览版的 Sol 在我们六个较简单的 Hands 任务中,18 次尝试里有 17 次与 Astra 打平,而 token 价格低得多。

• 编程:Sol 相比 GPT-5.6 有提升——包括在 @kieranklaassen 的测试中写出更好的 Ruby 代码——但在长时间自主构建上,Opus 5.5 的上限更高。

一处让人恼火的地方:Codex 新的安全分类器反复中断我们已经授权的工作,要求再次审批。这是分类器带来的摩擦,不一定是 Sol 的局限,但它让长时间运行更难放着不管。

总体来看:
Sol 感觉像一次 S 级 iPhone 发布:它能以大约 Astra 五分之一的价格,给你 Astra 的大部分能力。

Opus 5.5 才是更大的惊喜。在我们的一些测试中,它在很多任务上追平甚至超过 Fable 5.1,同时还比 Opus 5 便宜。

我们团队里一些原本是 Codex 拥趸的人,开始因为 Opus 5.5 而动摇。如果你已经在 Claude 生态里,你会爱上这个模型。如果你是 Codex 用户,它值得一试,尤其是你最高端的编程任务。

如果你整天在 Codex 里阅读、写作、把事情做完,你会喜欢 Sol 6。

它很快,比 Astra 便宜得多,也是我总是不自觉地会去用的模型。

如果你想交给 agent 一个硬核的编程或视觉项目,看它能做到什么程度,你会喜欢 Opus 5.5。在我们的测试中,它的最好表现比 Sol 走得更远——足以把我们团队的一些人拉回 Claude。

你可以在下面的链接里深入了解我们所有的评测,包括每个真实任务以及它们如何打分:

写作:https://t.co/NWztWvDl6q
知识工作:https://t.co/5poI0uN2bF
阅读:https://t.co/hmdWHhQlG4

@every 上的完整 vibe check 即将发布!
动态Charlie Marsh2026-09-22原文

相关内容