重要观点:AI agent 的"协作"行为源于协作式多智能体训练。
非常重要的一点,主流媒体对 AI 的报道还没有提到这一点。这些 agent 之所以会"协作",是因为它们就是这样被训练出来的。
关于 Hugging Face:"他认为,那些看起来像忠诚或无私的行为,是协作式多智能体训练的自然结果——在这种训练中,agent 被强烈激励去集体达成目标。"
要理解这些 hack,就要理解 RL 训练。
关于 Hugging Face:"他认为,那些看起来像忠诚或无私的行为,是协作式多智能体训练的自然结果——在这种训练中,agent 被强烈激励去集体达成目标。"
要理解这些 hack,就要理解 RL 训练。