动态

推出ViBench,比较GPT 5.5和Opus 4.8在应用开发中的表现

推出ViBench,比较GPT 5.5和Opus 4.8在应用开发中的表现
Amjad Masad
基准测试将GPT 5.5评为SWE最佳模型,但它在端到端制作应用方面是否最佳?事实证明,Opus 4.8在价格和性能上仍然是vibe coding的王者。推出ViBench:第一个基于实际任务的应用创建基准测试 https://t.co/lLDLtrO56p
动态Amjad Masad2026-06-04原文

相关内容