动态

作者分析OpenAI与Anthropic模型竞争态势

作者分析OpenAI与Anthropic模型竞争态势
jason
1. 这就是为什么@thsottiaux和@OpenAI对GPT-5.6感到乐观(截图来自@datacurve的最新DeepSWE,出自@theo的视频)。

2. 大多数其他SWE基准测试已经过时。Anthropic承认Claude在swe-bench pro上作弊。我认为DeepSWE可能是目前最重要的5个AI基准之一。

3. GPT-5.5在Opus 4.8发布前一个月就已经问世,并且仍然在性能上优于Anthropic最新的Fable 5。

4. 换句话说,以编程模型闻名的Anthropic,已经有了两次额外机会来创建能与GPT-5.5在性价比上竞争的编程模型,但都失败了。

5. 大多数基准测试观察者忽略的一个小秘密?GPT-5.5 xhigh甚至都不是OpenAI最好的模型。最好的模型是GPT-5.5 Pro,它很少被基准测试。

6. 当/如果科技推特、主流媒体和华尔街开始意识到这一点,这对Anthropic将非常不利。

7. 看起来Anthropic所有的IPO末日营销炒作并不能真正让他们的模型变得更好或更高效。

8. 这就是为什么Anthropic现在开始与全国性新闻公司进行公关巡演,因为他们看到了不祥之兆:OpenAI的模型在关键领域更好,其Codex工具也更优。

9. AnAnthropic在IPO上超越OpenAI的最佳途径只有:

A) 通过公关巡演控制公众叙事
B) 迷惑企业客户(代理模型运行中断循环、token最大化,而公司毫不知情)
C) 逐字复制Codex,就像Google试图用Antigravity那样,因为Anthropic的Caude桌面产品是一个支离破碎、孤立无援的混乱体,没有统一的内存。
动态jason2026-06-12原文

相关内容