行业新闻

通过模拟部署预测发布前的模型行为

通过模拟部署预测发布前的模型行为

OpenAI 的新方法能提前模拟部署场景,预测模型行为,避免发布后出问题。

OpenAI 提出 Deployment Simulation(部署模拟),用真实对话数据模拟部署环境,在模型发布前预测其行为,从而提升安全评估的准确性。

正文摘录

June 16, 2026 [研究](https://openai.com/news/research/) 通过模拟部署预测模型在发布前的行为 利用真实的对话上下文,在发布前更好地估计模型的不良行为。 [阅读论文](https://cdn.openai.com/pdf/predicting-llm-safety-before-release-by-simulating-deployment.pdf) 分享 引言 在发布新模型之前,实验室不仅需要了解它能做什么,还需要了解它在实际使用中可能表现如何,包括可能引入哪些新风险。随着能力的增强,这一点变得更为重要。作为我们预部署安全审查的一部分,我们利用有针对性的评估、红队测试和其他检查来了解模型行为。现在,我们已开始使用一种在模型部署前模拟部署的方法,这添加了一个互补的信号:一种类似部署的预览,展示候选模型在到达用户手中之前可能的表现。 部署模拟(Deployment Simulation,一种模拟未来部署的方法) 正是用于在实际部署前模拟未来部署。我们通过以隐私保护的方式将之前的对话重放给新的候选模型来实现这一点。这使得我们能够在发布前研究新模型在真实上下文中的反应,包括是否会出现新的不良行为以及它们出现的频率。 在多个 GPT-5 系列 Thinking 模型的部署中,部署模拟改善了我们对于不良行为率的估计,帮助在发布前发现了新型的对齐失败,并降低了模型察觉自身正在被测试的风险。我们还将该方法应用于挑战性的智能体化(agentic)部署,证明了它可以扩展到涉及工具使用的更复杂的智能体场景,也可用于内部模型部署前的风险评估。 在模型开发过程中,我们已经利用部署模拟中的洞察来发现传统评估的盲点,并为缓解措施和部署决策提供信息。随着我们使该流程更易于运行,我们预计它将在未来的模型开发过程中发挥更大作用。

阅读原文(openai.com)→

行业新闻2026-06-16原文

相关内容