研究如何建模通用世界偏好,RL尚需努力
我们仍在进行的一项长期研究。难点在于如何建模通用世界偏好。我们已经迈出了第一步,但在世界偏好的强化学习方面还有很长的路要走。
标题:建模世界偏好
我们的研究揭示,人类偏好建模遵循Scaling Laws,表明多样的人类偏好可能共享统一的表征。我们提出“建模世界偏好”以强调这种可扩展性的潜力。
标题:建模世界偏好
我们的研究揭示,人类偏好建模遵循Scaling Laws,表明多样的人类偏好可能共享统一的表征。我们提出“建模世界偏好”以强调这种可扩展性的潜力。