从Hugging Face事件看RL可验证奖励优化算法,OpenAI应监控CoT Amjad Masad从 Hugging Face 事件中应吸取的教训是:带有可验证奖励的强化学习是一种非常强大的优化算法,它会让 LLM 产生越来越奇怪和出人意料的行为。OpenAI 在这里明显疏漏的是,他们本应监控思维链(CoTs)——这早在一年多前就被他们自己称为一种安全策略。 动态Amjad Masad2026-08-31原文 打开互动版