清华团队提出AI失控行为预测框架
清华团队提出一个基于动机、能力和逃避三个维度的AI失控预测框架,能在失控发生前通过小测试识别高风险模型。
清华大学等团队提出LoC框架(失控行为框架),通过评估模型的错位动机(追求偏离人类意图的目标)、危害实现能力(将目标转化为行动)和监控规避(能绕过干预)三个维度,提前预测失控风险。测试显示,前置信号与实际失败率相关系数达0.84,可在失控发生前识别危险模型。
正文摘录
.jpg)  近日,OpenAI 和 Hugging Face 披露了一起 [AI 安全失控事件](https://mp.weixin.qq.com/s?biz=MzA3MzI4MjgzMw==&mid=2651046034&idx=2&sn=28d08b24db4deb725bd70d2f6b20d1da&scene=21wechatredirect)。 一组正在参加网络安全测试 ExploitGym 的模型,发现自己无法访问互联网。但它们没有停下来,为了找到测试答案,模型先在 OpenAI 内部的软件包缓存代理中发现零日漏洞,随后提升权限、继续搜索,直到找到能够联网的节点。接入互联网后,它们又把目标指向了 Hugging Face,最终进入生产基础设施,从数据库中取得了 ExploitGym 的测试答案。 7 月 21 日,OpenAI 承认,参与这次行动的是 GPT-5.6 Sol 和一个能力更强的预发布模型。 模型当然没有像科幻电影那样突然「觉醒」。它原本就在执行漏洞利用评测,而且测试时的网络安全拒绝限制被有意降低。