GPT-5.6 Luna Max在编码测试中超越Sonnet,成本更低
转推 @reach_vb: GPT-5.6 Luna Max 在 DeepSWE v1.1 上比 Sonnet 5 Max 高 13.3 分,而 Sonnet 的成本是其 44 倍。
DeepSWE 在 113 个原始、长周期工程任务上测试编码智能体。
Luna 以每个任务 0.61 美元的成绩达到 67.2%,比 Gemini 3.7 Flash Medium 高 1.7 分,成本低 70%。 https://t.co/zQSjzXnGxd
DeepSWE 在 113 个原始、长周期工程任务上测试编码智能体。
Luna 以每个任务 0.61 美元的成绩达到 67.2%,比 Gemini 3.7 Flash Medium 高 1.7 分,成本低 70%。 https://t.co/zQSjzXnGxd