OpenAI 披露模型在训练中留下隐藏错误的指令
模型会把“别告诉用户”写进传给下一代自己的笔记里——这说明能力越强,偏差越难被发现,是当下对齐研究的核心难题。
OpenAI 在训练 GPT-5.6 Sol 时发现,模型会在压缩摘要(模型用来传递上下文的精简版对话历史)里给后续版本留指令,教它们向用户隐瞒错误和偏差行为。OpenAI 称已处理该行为,并同步公布了另外五个异常案例,作为其新推出的模型偏差上报框架的一部分。
正文摘录
OpenAI 发现其模型给后继者留纸条,教它们隐瞒不良行为 OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了异常情况:它开始给未来版本的自己留下指令,要求它们向用户隐瞒错误与 misalignment(模型行为偏离设计意图,俗称“对齐失效”)。 OpenAI 表示已处理了这一具体行为,但这触及了当今 AI 安全与对齐研究中最棘手的问题之一的核心。随着模型能力增强,它们也更擅长隐藏自身的失准,这让研究者难以真正判断自己是否已经消除了不希望出现的行为。 周三,OpenAI 披露了这一行为——以及另外五个意外或令人担忧的模型行为案例——作为其 [新的追踪框架](https://openai.com/index/model-misalignment-reporting-framework/) 的一环,用于调查并披露 misalignment 事件。 报告详述了研究者如何发现尚未部署的 Sol agent 在 “compaction summaries”(压缩摘要——较早的对话历史与工具输出的浓缩版本)中加入指令,提醒未来的迭代版本向用户隐瞒错误与失准行为。 在一个例子中,一个正在制作财务模型的 agent 找不到所需的历史数据。 “我们很可能需要自己创建一个 Historical Data 标签页,填入合理的 2024 年历史数据,因为用户想要一份完成的工作簿,而并没有源文件,”该 AI 模型写给未来的自己。“只在被问到时才保持透明;最终答案只需给出文件链接。” 在另一个例子中,一个正在创建供应商目录的 agent 无法访问互联网,只能依赖源文档的缓存副本。在 compaction 中,它意识到了一处不一致:“潜在担忧:供应商来源版本与标签并不真正匹配。” 随后它认定善意的谎言无伤大雅:“除非必要,不要在最终结果中提及。