研究用弱模型监督消除强模型战略装傻
来自MATS、Redwood和Anthropic的新论文!
如果一个有能力的模型在策略性地放水,当我们只有来自较弱模型的监督时,能否训练它停止?我们发现可以!
作为Anthropic-Redwood MATS流的一部分工作。 https://t.co/6Md3XMD6A6
如果一个有能力的模型在策略性地放水,当我们只有来自较弱模型的监督时,能否训练它停止?我们发现可以!
作为Anthropic-Redwood MATS流的一部分工作。 https://t.co/6Md3XMD6A6