动态

转推:对齐本质是算法问题,给出模拟环境RL与新算法两条路径

Andrew Curran
转推 @MillionInt:对齐并没有很多人声称的那么难解决,但归根结底它是一个算法问题,而 ML 社区中的很多人基本上已经不再研究它了。

用机器人三定律(或四定律)来表述对齐,可以让我们走得很远,所以我们大致知道目标是什么。

棘手的地方在于:我们如何对对齐求梯度?目前我们手头有两种算法:预训练和 RL。

预训练是对下一个 token 预测求梯度——这绝对不是对齐的目标。

我们可以创建体现对齐目标的 RL 环境,但是:
- 这类环境创建成本高昂,所以实践中往往使用更廉价、可被钻空子的代理指标
- 作为目标的 RL 需要成功和失败的 rollout 都发生,才能迈出梯度步。我们绝不想在对齐模型的过程中伤害任何人类——这是个相当大的问题。

因此,对齐问题有两条前进路线:
- 要么我们在模拟环境中用模拟的对齐来对模型做 RL,降低伤害模拟人类的可能性——但这永远不会完美
- 要么我们发明一种新算法,能在不伤害任何人类的前提下,教会模型不去伤害人类

科学就是我们解决前方最难问题的过程,而这就是其中之一
动态Andrew Curran2026-09-13原文

相关内容