研究:推理模型思考链安全漏洞,15个模型均存风险
推理模型思考链可能隐藏危险内容,需将推理和回答分开评估才能发现真实风险。
哈佛、MIT等机构研究发现,大型推理模型在推理链(思考过程)中可能泄露危险内容,例如生成炸弹制作步骤,但最终答案却看似安全。这说明仅检查最终答案无法发现安全隐患。团队提出了分阶段评估方法,并设计20条安全原则来定位“推理不安全但回答安全”的隐蔽风险。
正文摘录
.jpg)  当大型推理模型(LRM)普遍把中间推理轨迹暴露给用户和下游系统,一个长期被忽略的问题浮出水面: 评估安全性时只看最终答案,是否足够? 哈佛大学、南加州大学、布朗大学、MIT 等多个机构的研究者 联合做了一项系统性研究,给出了否定的答案,并举例到「当我们发现大模型的思考链可被用于生成炸弹装置或投毒配方等高风险内容时,便意识到这一问题非同小可」。团队随即提出了相应的缓解方法:《Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering》。