动态

提出因果评分提高奖励模型鲁棒性

提出因果评分提高奖励模型鲁棒性
Rahul Madhavan
介绍:通过因果评分实现稳健的奖励建模 📑
👉 https://t.co/sBLN2m4Ssx

RLHF 流水线的一个主要问题是奖励黑客——奖励模型抓住虚假线索(如长度、风格)而非真实质量。我们能否通过使奖励模型对虚假线索更鲁棒来系统性地解决奖励黑客?
#RLAIF #因果推断
🧵
AK
通过因果评分实现稳健的奖励建模 https://t.co/Nmdt6kaPLZ
动态Rahul Madhavan2025-06-25原文

相关内容