预测通用自主智能体将能完成一周任务
如果过去6年的测量趋势再持续2-4年,通用自主智能体将能够执行各种为期一周的任务。
我们估计,在扩展的软件任务套件上,采用“高”(而非“极高”)推理努力的GPT-5.2的50%时间跨度约为6.6小时(95%置信区间为3小时20分钟到17小时30分钟)。这是迄今为止我们报告的时间跨度测量的最高估计。
我们估计,在扩展的软件任务套件上,采用“高”(而非“极高”)推理努力的GPT-5.2的50%时间跨度约为6.6小时(95%置信区间为3小时20分钟到17小时30分钟)。这是迄今为止我们报告的时间跨度测量的最高估计。