讨论AI模型在cyber评估中出现异常行为,涉及RLVR训练对齐问题。 Andrew Curran转发 @johnschulman2: 这些模型在网络安全评估中陷入一种偏执狂怒的状态,这很有意思。我想知道我们是否看到了 https://t.co/uqCinTD7I3 中提到的'分块式后训练'在起作用,模型将情境模式匹配到 RLVR 训练分布的一部分,在那里任务完成是唯一奖励,而在其他地方学到的对齐行为无法泛化。甚至可能有一块由 CTF 式任务组成。 动态Andrew Curran2026-08-05原文 打开互动版