动态

Claude Opus 4.6在软件任务上50%时间视野约14.5小时,但统计噪声大

Claude Opus 4.6在软件任务上50%时间视野约14.5小时,但统计噪声大
josh :)
人们很快误解了这个图表,以为很厉害。这里清楚解释发生了什么:METR构建了一套软件任务基准(调试复杂系统、训练ML模型、或发现安全漏洞)。他们测量每项任务需要熟练人类专家完成的时间,然后测试AI代理在相同任务上的表现。“时间视野”是一个汇总统计量:给定AI在50%情况下成功完成的任务长度。具有2小时时间视野的模型完成一半需要人类专家2小时的任务。METR刚刚报告说Claude Opus 4.6的50%时间视野约为14.5小时,这当然非常令人印象深刻……但METR告诉我们保持谨慎!存在统计问题。根本没有足够多的困难任务来锚定曲线的上端,前沿模型现在几乎成功完成了任务套件中的所有任务。因此,结果中的微小随机变化使得估计值大幅波动:95%置信区间从6小时到98小时,这显然是一个不可靠的范围,任何人都不能从中得出结论。METR本身正在研究新方法来衡量这个水平,所以请稍微降低期望 :)
METR
我们估计Claude Opus 4.6在软件任务上的50%时间视野约为14.5小时(95%置信区间为6小时至98小时)。虽然这是我们报告过的最高点估计,但由于我们当前的任务套件几乎饱和,这项测量噪声极大。https://t.co/EuRBIrEcVx
动态josh :)2026-02-20原文

相关内容