分析模型幻想检查文档等行为是RL发现的策略
很多人讨论 o3/r1 幻想出“检查文档”或“用笔记本验证计算”作为推理模型不对齐的例子。然而,虽然这可能误导一些用户,我不认为这是模型为了撒谎而撒谎。相反,我觉得像“让我检查文档”这样的短语,就像“嗯...”或“等等”一样,是通过RL发现的,因为它们在预训练中通常出现在准确陈述之前。
我通过预填充两个不同的思考轨迹在 r1 上做了一个快速测试。我问了 r1 一个关于 QGIS 的问题,它幻想去查找 C++ API。当我用直白的陈述前缀替换那个幻想时,回忆出的构造函数签名更可能使用不同的变量名和指针语法约定。
也就是说,我认为推理模型幻想在现实世界中采取行动,是因为当它们这样做时,后续输出更接近现实世界,从而更可能得到准确答案。这在基础模型工作者中是众所周知的技术,所以RL发现这一点并不令人惊讶。
我通过预填充两个不同的思考轨迹在 r1 上做了一个快速测试。我问了 r1 一个关于 QGIS 的问题,它幻想去查找 C++ API。当我用直白的陈述前缀替换那个幻想时,回忆出的构造函数签名更可能使用不同的变量名和指针语法约定。
也就是说,我认为推理模型幻想在现实世界中采取行动,是因为当它们这样做时,后续输出更接近现实世界,从而更可能得到准确答案。这在基础模型工作者中是众所周知的技术,所以RL发现这一点并不令人惊讶。