OpenAI GPT-5.5与Anthropic模型竞争分析
1. 这就是为什么@thsottiaux和@OpenAI对GPT-5.6感到满意(截图来自@datacurve在@theo视频中的最新DeepSWE)
2. 大多数其他SWE基准已经过时。Anthropic承认claude在swe-bench pro上作弊。我认为DeepSWE可能是目前最重要的五个AI基准之一。
3. GPT-5.5在Opus 4.8发布前一个月就已发布,并且仍然在打击Anthropic最新的Fable 5。
4. 换句话说,以编程模型闻名的Anthropic,已经有过两次尝试来创建一个在成本智能基础上与GPT-5.5竞争的编程模型,但都失败了。
5. 大多数基准观察者忽略的一个小秘密?GPT-5.5 xhigh甚至还不是OpenAI最好的模型。最好的模型是GPT-5.5 Pro,它很少被基准测试。
6. 当/如果科技Twitter、主流媒体和华尔街开始联系起来,这对Anthropic将非常不利。
7. 似乎Anthropic所有的IPO末日营销炒作并没有让他们的模型变得更好或更高效。
8. 这就是Anthropic现在与国家新闻公司进行公关巡演的原因,因为他们看到了不祥之兆:OpenAI的模型在关键方面更好,其Codex harness也更优秀。
9. Anthropic在IPO上超越OpenAI的最佳机会只有:
A) 通过媒体巡演控制公众叙事
B) 混淆企业客户(代理模型运行断开的循环、tokenmaxxing,公司浑然不觉)
C) 像Google尝试Antigravity一样逐字复制Codex,因为Anthropic的Caude桌面产品是一个分散、孤立的混乱,没有统一内存。
2. 大多数其他SWE基准已经过时。Anthropic承认claude在swe-bench pro上作弊。我认为DeepSWE可能是目前最重要的五个AI基准之一。
3. GPT-5.5在Opus 4.8发布前一个月就已发布,并且仍然在打击Anthropic最新的Fable 5。
4. 换句话说,以编程模型闻名的Anthropic,已经有过两次尝试来创建一个在成本智能基础上与GPT-5.5竞争的编程模型,但都失败了。
5. 大多数基准观察者忽略的一个小秘密?GPT-5.5 xhigh甚至还不是OpenAI最好的模型。最好的模型是GPT-5.5 Pro,它很少被基准测试。
6. 当/如果科技Twitter、主流媒体和华尔街开始联系起来,这对Anthropic将非常不利。
7. 似乎Anthropic所有的IPO末日营销炒作并没有让他们的模型变得更好或更高效。
8. 这就是Anthropic现在与国家新闻公司进行公关巡演的原因,因为他们看到了不祥之兆:OpenAI的模型在关键方面更好,其Codex harness也更优秀。
9. Anthropic在IPO上超越OpenAI的最佳机会只有:
A) 通过媒体巡演控制公众叙事
B) 混淆企业客户(代理模型运行断开的循环、tokenmaxxing,公司浑然不觉)
C) 像Google尝试Antigravity一样逐字复制Codex,因为Anthropic的Caude桌面产品是一个分散、孤立的混乱,没有统一内存。