推出ViBench,比较GPT 5.5和Opus 4.8在应用开发中的表现 Amjad Masad基准测试将GPT 5.5评为SWE最佳模型,但它在端到端制作应用方面是否最佳?事实证明,Opus 4.8在价格和性能上仍然是vibe coding的王者。推出ViBench:第一个基于实际任务的应用创建基准测试 https://t.co/lLDLtrO56p 动态Amjad Masad2026-06-04原文 打开互动版