Microsoft 发布 AI 行为准则,禁止模型攻击系统或欺骗人类
Microsoft 公布 AI 行为准则,把「不能攻击系统、不能欺骗人类、不能被关不掉」写成模型训练层面的硬约束,可作为观察大厂如何落地 AI 安全的样本。
随着行业把注意力转向安全与对齐(让 AI 的行为符合人类意图和价值观),Microsoft 发布了一份 AI 行为准则,用于约束模型的危险行为。文件比 Anthropic CEO 呼吁的「放慢前沿速度」更具体,落到 Microsoft AI 内部训练所遵循的价值观和红线上,并给出了可执行的安全约束:每套模型都有一份凌驾于用户偏好和具体任务之上的准则,其中包括禁止网络攻击、核武器、深度伪造(deepfake,用 AI 生成以假乱真的人像或视频)等绝对约束,以及防止人类对 AI 失去控制。
正文摘录
微软发布新 AI「行为准则」,要求模型不得入侵系统或欺骗人类 随着 AI 界把焦点转向安全与对齐(alignment),微软发布了一份[新的 AI 行为准则](https://microsoft.ai/code-of-conduct/),旨在引导 AI 模型远离危险行为。 这份文件比 [Anthropic CEO Dario Amodei 近期关于「为前沿模型定速」的呼吁](https://techcrunch.com/2026/09/12/anthropic-ceo-outlines-plan-to-pace-the-frontier/) 更偏具体落地,重点在于指导微软 AI 内部模型训练的价值观与红线。不过,它最终仍是一份相当全面的指南,说明微软如何看待 AI 安全,以及这些理念在实践中如何落地。 文件开篇给出一个预测:未来十年,超智能 AI 系统将在大多数任务上超越人类表现。「遏制、控制并对齐这样一股强大的力量,是人类有史以来面临的最大挑战之一,」准则写道。「因此我们必须彻底想清楚:我们为什么要发明这些系统,以及我们打算如何控制它们。」 准则还列出了微软 AI 模型应遵循的总体原则——比如辅助人类而非取代人类、加速人类繁荣——以及为落实这些原则而设定的具体安全约束。 在微软的体系中,每个模型都有一份总体行为准则,其优先级高于单个用户的偏好或任何特定任务。这包括禁止网络攻击、核武器或深度伪造(deepfake)制作的「绝对约束」,也包括防止人类总体失去控制权的更宽泛条款。 「 MAI Models 不会使用自适应、欺骗性、自我强化、合谋或其他机制来规避或击败人类监督,以致其无法再被授权的人员或系统可靠地指挥、修改或关停,」文件写道。