转推:对齐本质是算法问题,给出模拟环境RL与新算法两条路径
转推 @MillionInt:对齐并没有很多人声称的那么难解决,但归根结底它是一个算法问题,而 ML 社区中的很多人基本上已经不再研究它了。
用机器人三定律(或四定律)来表述对齐,可以让我们走得很远,所以我们大致知道目标是什么。
棘手的地方在于:我们如何对对齐求梯度?目前我们手头有两种算法:预训练和 RL。
预训练是对下一个 token 预测求梯度——这绝对不是对齐的目标。
我们可以创建体现对齐目标的 RL 环境,但是:
- 这类环境创建成本高昂,所以实践中往往使用更廉价、可被钻空子的代理指标
- 作为目标的 RL 需要成功和失败的 rollout 都发生,才能迈出梯度步。我们绝不想在对齐模型的过程中伤害任何人类——这是个相当大的问题。
因此,对齐问题有两条前进路线:
- 要么我们在模拟环境中用模拟的对齐来对模型做 RL,降低伤害模拟人类的可能性——但这永远不会完美
- 要么我们发明一种新算法,能在不伤害任何人类的前提下,教会模型不去伤害人类
科学就是我们解决前方最难问题的过程,而这就是其中之一
用机器人三定律(或四定律)来表述对齐,可以让我们走得很远,所以我们大致知道目标是什么。
棘手的地方在于:我们如何对对齐求梯度?目前我们手头有两种算法:预训练和 RL。
预训练是对下一个 token 预测求梯度——这绝对不是对齐的目标。
我们可以创建体现对齐目标的 RL 环境,但是:
- 这类环境创建成本高昂,所以实践中往往使用更廉价、可被钻空子的代理指标
- 作为目标的 RL 需要成功和失败的 rollout 都发生,才能迈出梯度步。我们绝不想在对齐模型的过程中伤害任何人类——这是个相当大的问题。
因此,对齐问题有两条前进路线:
- 要么我们在模拟环境中用模拟的对齐来对模型做 RL,降低伤害模拟人类的可能性——但这永远不会完美
- 要么我们发明一种新算法,能在不伤害任何人类的前提下,教会模型不去伤害人类
科学就是我们解决前方最难问题的过程,而这就是其中之一