行业新闻

Claude Sonnet 5 性能逼近 Opus 但新分词器致实际费用上升

Sonnet 5 性能逼近 Opus,但新分词器使 Token 消耗增加,实际成本可能高于预期,开发者需注意隐藏涨价。

A社发布 Sonnet 5,号称“最能干活”的 Sonnet,跑分逼近 Opus,标价仅为后者的六成。但新分词器将同一段文字切出更多 Token,实际消耗涨了三成,开发者实测英文文本 Token 数增加 42%。

正文摘录

A 社你解释下,啥叫 Sonnet 5 比 Fable 5 还贵? A 社把它定位成迄今为止“最能干活”的 Sonnet,能自己规划任务、调用浏览器和终端。 其跑分逼近自家最贵的 Opus 4.8,价格却只要后者的六成左右,着实一款“Opus 平替”。 具体数字摆在那儿,其 agentic coding 跑分 SWE-bench Pro 63.2%,比上一代 Sonnet 4.6 高出 5 个百分点。 开发者 Simon Willison 做了件简单的事,把同一段文字分别喂给新旧两个模型计数。 结果发现,Sonnet 5 虽然表面上价格一样,但账单上的 Token 消耗数字偷偷涨了三成。 模型可以自己拆解任务、调用浏览器和终端这类工具,把一件多步骤的活一口气干完,中间不掉链子,干完之后还会主动检查一遍自己的输出,不用人提醒。 agentic coding 测试 SWE-bench Pro,Sonnet 5 拿到 63.2 分,Sonnet 4.6 是 58.1 分,Opus 4.8 是 69.2 分,Sonnet 5 站在两代之间,离 Opus 只差 6 分。 computer use 测试 OSWorld-Verified,Sonnet 5 是 81.2%,Opus 4.8 是 83.4%,差距缩到 2.2 个百分点。 而在知识工作类测试 GDPval-AA v2 上,Sonnet 5 拿到 1618 分,反而比 Opus 4.8 的 1615 分还高出 3 分。 AI 编程平台 Factory 的工程师 Zimu Li 说,Sonnet 5 给他们的智能体提供了一层扎实的执行能力,能在杂乱的技术环境里持续编码、调用工具、排查问题,尤其适合那种需要长时间跟进、对技术细节要求高的工作流。

阅读原文(qbitai.com)→

行业新闻克雷西2026-07-01原文

相关内容