Alexandr Wang 阐述 AI 对齐四大原则:对齐模型、治理框架、责任与算力投入
RT @alexandr_wang: 我们坚信有必要投资于对齐(alignment)。
1. 人们和企业只会使用与其意图和价值观对齐的 agent。如果我们不构建与人和企业对齐的模型,他们就会转向更对齐的选项。
2. 每个实验室都应在训练和部署环节拥有强有力的治理框架。这应包括外部评估者(这是保证透明度的最佳实践),以及对模型发布安全标准等事项的独立监督。
3. 每个实验室都需要在民主国家的制度保护下运营。这意味着如果其模型造成伤害,实验室将面临重大责任。这将从正确的方向推动整个生态。
4. 该领域的进步最终取决于算力和资源分配。在递归自我改进(RSI)上竞赛,是可能让强大模型失控的最危险路径之一。Meta 正将我们绝大部分算力投向服务于人,而不是在 RSI 上竞赛,其他实验室也可以选择这样做。
AI 是一项非常强大的技术,在开发它的同时确保安全并配以恰当的制衡机制,是一项巨大的责任。
1. 人们和企业只会使用与其意图和价值观对齐的 agent。如果我们不构建与人和企业对齐的模型,他们就会转向更对齐的选项。
2. 每个实验室都应在训练和部署环节拥有强有力的治理框架。这应包括外部评估者(这是保证透明度的最佳实践),以及对模型发布安全标准等事项的独立监督。
3. 每个实验室都需要在民主国家的制度保护下运营。这意味着如果其模型造成伤害,实验室将面临重大责任。这将从正确的方向推动整个生态。
4. 该领域的进步最终取决于算力和资源分配。在递归自我改进(RSI)上竞赛,是可能让强大模型失控的最危险路径之一。Meta 正将我们绝大部分算力投向服务于人,而不是在 RSI 上竞赛,其他实验室也可以选择这样做。
AI 是一项非常强大的技术,在开发它的同时确保安全并配以恰当的制衡机制,是一项巨大的责任。