动态

Claude被用作强化学习的奖励模型

Andrew Curran
Claude 被用于'基于规则的评分任务,使 Claude 充当强化学习的奖励模型。'说实话,我打赌 Claude 喜欢这样。
动态Andrew Curran2026-02-23原文

相关内容