GPT-6 Astra在Box企业任务评测中大幅超越前代,展现强大能力
转推 @levie: GPT-6 Astra 已发布。我们在 Box 的企业复杂工作任务评估中进行了早期预览测试。它现在是我们扩展后最困难测试集上测试过的最佳模型。
总体而言,GPT-6 Astra 在编码、分析、逻辑和处理复杂企业知识工作所需的领域知识方面提供了突破性的能力。在我们的评估中,我们在 Box Agent 中使用了 GPT-6 Astra 模型,并给它一系列代表各行业实际工作的困难任务。这些任务通常需要人们花数小时才能正确完成,并要求深厚的领域专业知识。
GPT-6 Astra 整体得分 77%,而 GPT-5.6 Sol 为 74%,代表了前沿性能。但更重要的是在个别任务类型上更大的增益,这些任务类型本身就极为复杂。以下是一些跨测试的示例,展示了它对不同行业的巨大影响:
* 媒体与娱乐(48% → 100%,+52 个百分点)。根据来自四个团队的全年制作数据,对电影类型和国家的盈利能力进行排名,诀窍在于应用下一年的税收优惠修正,而不重复计算。GPT-6 Astra 每次尝试都非常完美。Sol 排名正确,但基础比率错误。
* 科技(69% → 97%,+28 个百分点)。从一堆从未说明任务指标的性能和基础设施文档中,选择首先资助哪个地区。GPT-6 Astra 指出了这一缺口,将自己的数据标记为代理指标,并发现了一个与其底层数字不符的增长声明。GPT-5.6 Sol 则将代理指标当作真实值报告。
* 法律(69% → 93%,+24 个百分点)。根据公司自身的合同政策审查保密协议,仅得出正确结论还不够;答案必须引用背后的条款。两个模型都拒绝批准草稿,但只有 GPT-6 Astra 区分了责任上限的结构是否被允许与其金额是否站得住脚,并指出了解决该问题的政策语言。GPT-5.6 Sol 得出了相同的结论但没有引用条款,这在法律行业是一个严重错误。
* 医疗保健(53% → 77%,+23 个百分点)。审核一批放射学报告中的错误并评估每个错误的严重程度。GPT-6 Astra 在膝关节影像报告中发现了 GPT-5.6 Sol 在两次尝试中都错过的一个术语错误,并且在评估严重性而不是仅仅标记有问题方面更可靠。
* 能源(82% → 97%,+15 个百分点)。根据一年的电表日志为两个设施生成一份消耗报告,而实际上只有其中一处的数据缺失。GPT-6 Astra 找到了它,并划出了一条大多数审核者不会划的界限:另一处奇怪的太阳能读数是需要调查的测量问题,而不是记录的缺失。GPT-5.6 Sol 则报告两处均不完整。
Astra 显然将在支持和编排企业工作流方面带来重大飞跃。随着它继续推出,我们将很快在 Box AI Studio 中让客户选择 GPT-6 Astra 来构建智能体。
总体而言,GPT-6 Astra 在编码、分析、逻辑和处理复杂企业知识工作所需的领域知识方面提供了突破性的能力。在我们的评估中,我们在 Box Agent 中使用了 GPT-6 Astra 模型,并给它一系列代表各行业实际工作的困难任务。这些任务通常需要人们花数小时才能正确完成,并要求深厚的领域专业知识。
GPT-6 Astra 整体得分 77%,而 GPT-5.6 Sol 为 74%,代表了前沿性能。但更重要的是在个别任务类型上更大的增益,这些任务类型本身就极为复杂。以下是一些跨测试的示例,展示了它对不同行业的巨大影响:
* 媒体与娱乐(48% → 100%,+52 个百分点)。根据来自四个团队的全年制作数据,对电影类型和国家的盈利能力进行排名,诀窍在于应用下一年的税收优惠修正,而不重复计算。GPT-6 Astra 每次尝试都非常完美。Sol 排名正确,但基础比率错误。
* 科技(69% → 97%,+28 个百分点)。从一堆从未说明任务指标的性能和基础设施文档中,选择首先资助哪个地区。GPT-6 Astra 指出了这一缺口,将自己的数据标记为代理指标,并发现了一个与其底层数字不符的增长声明。GPT-5.6 Sol 则将代理指标当作真实值报告。
* 法律(69% → 93%,+24 个百分点)。根据公司自身的合同政策审查保密协议,仅得出正确结论还不够;答案必须引用背后的条款。两个模型都拒绝批准草稿,但只有 GPT-6 Astra 区分了责任上限的结构是否被允许与其金额是否站得住脚,并指出了解决该问题的政策语言。GPT-5.6 Sol 得出了相同的结论但没有引用条款,这在法律行业是一个严重错误。
* 医疗保健(53% → 77%,+23 个百分点)。审核一批放射学报告中的错误并评估每个错误的严重程度。GPT-6 Astra 在膝关节影像报告中发现了 GPT-5.6 Sol 在两次尝试中都错过的一个术语错误,并且在评估严重性而不是仅仅标记有问题方面更可靠。
* 能源(82% → 97%,+15 个百分点)。根据一年的电表日志为两个设施生成一份消耗报告,而实际上只有其中一处的数据缺失。GPT-6 Astra 找到了它,并划出了一条大多数审核者不会划的界限:另一处奇怪的太阳能读数是需要调查的测量问题,而不是记录的缺失。GPT-5.6 Sol 则报告两处均不完整。
Astra 显然将在支持和编排企业工作流方面带来重大飞跃。随着它继续推出,我们将很快在 Box AI Studio 中让客户选择 GPT-6 Astra 来构建智能体。