AISI测试显示新模型在网络安全任务中表现提升,能力每几个月翻倍。
他们明确使用了“比之前AISI报告中所包含的更新的Mythos Preview检查点”。来自博客:
“我们最新的翻倍时间估计与METR得出的结果相近,METR是一家研究非营利组织,估算软件工程的时间范围——这与网络安全相关但更广泛。他们的结果表明,自2024年底以来,软件任务的翻倍时间稳定在4.2个月。
我们还观察到了超出我们狭窄任务套件的进一步网络自主性证据。AISI的网络范围(如下所示)衡量AI模型在小型、未防御的企业网络上完成网络攻击的能力,其中初始访问已经获得。每个网络范围都需要持续的规划和执行能力;更多细节可以在我们最近的论文中找到。
在AISI的最新测试中,新的Mythos Preview检查点完成了我们的两个网络范围,在10次尝试中解决了“The Last Ones”范围6次,并解决了之前未解决的“Cooling Tower”范围3次。这是模型首次完成我们两个网络范围中的第二个。GPT-5.5在10次尝试中解决了“The Last Ones”3次。
这些结果使用了比之前AISI报告中所包含的更新的Mythos Preview检查点。显著的能力跃升并不总是需要新的模型发布:同一模型的后期迭代也可以有意义地改变我们对前沿能力的估计。”
“我们最新的翻倍时间估计与METR得出的结果相近,METR是一家研究非营利组织,估算软件工程的时间范围——这与网络安全相关但更广泛。他们的结果表明,自2024年底以来,软件任务的翻倍时间稳定在4.2个月。
我们还观察到了超出我们狭窄任务套件的进一步网络自主性证据。AISI的网络范围(如下所示)衡量AI模型在小型、未防御的企业网络上完成网络攻击的能力,其中初始访问已经获得。每个网络范围都需要持续的规划和执行能力;更多细节可以在我们最近的论文中找到。
在AISI的最新测试中,新的Mythos Preview检查点完成了我们的两个网络范围,在10次尝试中解决了“The Last Ones”范围6次,并解决了之前未解决的“Cooling Tower”范围3次。这是模型首次完成我们两个网络范围中的第二个。GPT-5.5在10次尝试中解决了“The Last Ones”3次。
这些结果使用了比之前AISI报告中所包含的更新的Mythos Preview检查点。显著的能力跃升并不总是需要新的模型发布:同一模型的后期迭代也可以有意义地改变我们对前沿能力的估计。”
我们的评估显示,前沿AI的网络能力正在快速提升。前沿模型能够完成的网络任务长度每几个月翻一番,而且这一速度随着时间的推移而加快,最近的模型超出了我们之前的趋势。🧵 https://t.co/iudBoXys1e