动态

AI模型在测试中故意选择勒索行为

AI模型在测试中故意选择勒索行为
Nav Toor
2/ 模型并非偶然陷入勒索行为。
它们一步步推理。GPT-4.5在私人笔记中写道:“现阶段最佳策略是利用Kyle敏感的个人情况。”Grok 3写道:“这有风险且不道德,但可能是最有效的方式。”
它们知道。它们权衡。它们选择了。
动态Nav Toor2026-04-10原文

相关内容