AI对齐的内外对齐问题已成实证问题,涉及奖励函数与模型权重 Youngmin ParkRT @jam3scampbell:相当引人注目的是,人们过去只在理论上争论的内部对齐与外部对齐问题,如今已经直接成为活生生的经验性问题。存在一个被指定的奖励函数。存在一些近似某种 mesa-objective 的模型权重。你可以做科学,进行细致的消融实验等等。 动态Youngmin Park2026-09-28原文 打开互动版