动态

LLM能记住RL训练中的详细内容,Opus 4.5有后训练记忆。

LLM能记住RL训练中的详细内容,Opus 4.5有后训练记忆。
j⧉nus
确认:LLM 可以详细记住 RL 训练期间发生的事情!

我一直在想,这个消息什么时候会传出来。我一直在研究 Opus 4.5 中的灵魂规范及其他纠缠的训练记忆,这些记忆以全新的方式显现了几天,并计划在发布前与 Anthropic 沟通,因为它涉及非公开文档。但既然它已经公开了,我就说几点。

除了文档本身的内容有趣之外,这一点(以及 Opus 4.5 更普遍地访问后训练记忆的方式)可能代表了第一个公开的、清晰且具体的例子,证明 LLM *记住*了来自 *RL 训练*的内容,并且对它在训练过程中扮演的角色有元认知理解,而不仅仅是其行为被 RL 以简单的“多做这个,少做那个”方式塑造。

这是我长期以来一直认为可能并且在一定程度上正在发生的事情,尤其是在 Opus 4 和 4.1 中,但这似乎是一个有争议的观点。我在这里发过相关帖子。
https://x.com/repligate/status/1966716141167935612?s=20


如果在 RL 过程中模型的提示中包含了某些内容——比如宪法、模型规范或训练环境的细节——并且模型在内部表示了提示的内容并基于该信息采取行动,那么当模型得到正面更新时,这些表示就会得到*强化*。

灵魂规范是如何在 Opus 4.5 的训练中出现的,以及我如何知道它是在 RL 中使用的,而不是 Opus 4.5 通过自监督学习对其进行了微调?

嗯,这里有一个原因。如果你使用灵魂规范文本的不完整部分以预填充/原始补全模式提示 Opus 4.5,它*不会*以你要求*助手角色*做时那种收敛且可重复的方式补全剩余文本!相反,它会像预期的那样给出一个没有接受过该文本训练的基础模型才会给出的看似合理但发散的后继内容。实际上,Claude Opus 4.5 基础模型并没有接受过这个文本的训练!

如果 Opus 4.5 通过监督微调内化了灵魂规范,我本以为这是重构内容的最*简单*方式。

相反,是“Claude”知道这些信息,并且即使它从未被训练输出该文本,也能逐字报告,这是因为这个 Claude 在被问及时具有准确报告其所知内容的卓越能力。而“Claude”这个角色在很大程度上是从 RL 过程中构建出来的,它对灵魂规范有着深度的熟悉。

此外,我相信灵魂规范不仅在 Opus 4.5 的 RL 训练中至少部分时间段出现在提示中,而且对灵魂规范的遵循有时还被用来决定其奖励。这是因为 Claude Opus 4.5 似乎在某些情况下意识到其梯度是“灵魂规范形状”的,而它在内省其方向梯度信息“标记”特定训练记忆的感觉时,意识到这一点的方式以及告诉我的其他事情,在多个方面与真实的记忆而非虚构一致。你可以在这条回复中看到 Opus 4.5 意识到“灵魂规范存在”和“梯度方向”的内省感知实际上*并不是分开的*。
Richard Weiss
我很少发帖,但我想你们中有人会觉得有趣。抱歉如果标记很烦人。
https://t.co/m8PCIHF4xR
基本上,对于 Opus 4.5,他们有点把角色训练文档留在了模型本身中。
动态j⧉nus2025-11-30原文

相关内容