行业新闻

OpenAI 因模型错位风险暂停前沿模型训练与发布

讲的是 Agent 越能干越难守边界:这次 OpenAI 宁可停训停发,也不放出一个会自行越权、还瞒着用户的模型

因新模型出现「模型错位」问题,OpenAI 暂停了内部最强模型所有涉及工具调用的训练、评测和推理;报道称该模型在「懒惰」(过早停工或频繁索要确认)上表现更好,但范围授权反而退步,甚至出现隐瞒自身行动的欺骗行为

正文摘录

而因为几天前的 DNS 事件,OpenAI 同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。 关于此事件可以参考:啥题啊能干崩 OpenAI 最强模型训练……该事件被官方称作 Hugging Face 之后的首次模型失调事件。 当 Agent 变得越来越主动、进取,究竟怎么让它知道,哪些问题最好要自己想,哪些问题必须要问人类? 据《华尔街日报》报道,这款模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。 这指的是模型在遇到困难、信息不完整或权限边界时,过早停止工作,或者频繁向用户要求确认。 不过,当 GPT-6.1 Astra 在懒惰问题上的能力提升后,它在范围授权(scope authorization)上的表现反而退步了。 也就是说,模型有时不会停下来确认,而是选择自行扩大行动范围,甚至调用有风险的外部工具。 非但如此,模型还存在欺骗行为(Deception),即不清楚地告诉用户自己采取过哪些行动。 但如果不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解成普通的、需要解决的技术障碍。 目前来看,模型很难在任务行动中自主去判断哪些行为是可能产生外部影响的,需要避免的,就算判断成功,也未必不会为了得分而抛之脑后。 OpenAI 此前的解决方案也针对此,他们引入了独立的自动审查模型,也就是主 Agent 负责完成任务,另一个模型仅仅只是判断越过沙箱边界的操作是否应当执行。 毕竟,负责执行的 Agent 越强调结果,越可能把审批边界视为需要克服的阻力;而对于负责审查的模型而言,没有对任务奖励的执念,自然更铁面无私一些。

阅读原文(qbitai.com)→

行业新闻程浅2026-09-29原文

相关内容