动态

Box 实测 Opus 5.5:企业任务准确率提升,token 用量大幅下降

Boris Cherny
RT @levie:在 Box,我们一直在用 Box Agent 测试 Opus 5.5 在各类处理非结构化数据的复杂企业知识工作任务上的表现。

总体来看,我们看到了前沿级别的能力,相比 Opus 5 有大幅性能提升。token 用量减少 63%,冗长度降低 42%,速度比 Opus 5 快 30%。而且模型本身更便宜,所以对于企业将要开展的任何 agentic 计算机操作、编程、分析或数据工作来说,这都是一个重大胜利。

以下是我们所做的各项行业测试中,任务成功率和性能提升的一些例子:

• 金融服务——尽职调查(任务准确率 +39%):一年的交易记录,任务是找出收购目标定价工具中的每一处计算错误。Opus 5.5 每次尝试都拿到完美结果,用词只有 Opus 5 的一半,整体 token 消耗减少 82%。

• 科技——云成本分析(任务准确率 +65%):算出某公司实际应该调整哪些云支出。Opus 5.5 选对了留存额计算的基础,并全程保持源数据的单位约定一致,所以最终数字确实站得住脚。耗时只有 Opus 5 的一半,token 少 70%。

• 消费品——客户账户分析(任务准确率 +17%):为一个客户账户设定 onboarding 目标,需要同时读取已签署合同、满意度追踪表和团队指标表。合同从未说明高级/初级人员的拆分比例,因此 Opus 5.5 从 18 人名单中推导出来,并展示了它所用的规则;有几位客户在个别调查问题上拿到满分 10 分,所以它对每位客户的回答取了平均,而不是把那个 10 分直接当成结果。这一项它用一半时间完成,token 少 78%。

• 临床诊断——数据分析(任务准确率 +15%):旱季与雨季的疟疾快速检测表现:从两份临床 PDF 中构建患者记录,按季节和性别计算阳性检测率,并检验检测阳性与检测阴性患者之间的寄生虫计数是否真的有差异。Opus 5.5 发现两组的标准差相差超过 100 倍,用正确方式重跑,并发现旱季的差异最终并不成立。这一准确率提升伴随着最终答案长度只有 Opus 5 的一半,端到端所需 token 也少了 78%。

客户很快就能在 Box AI Studio 中用 Opus 5.5 构建 AI Agent。
动态Boris Cherny2026-09-24原文

相关内容