Anthropic研究称推理模型无法准确表达推理,质疑思维链监控安全性 AnthropicAnthropic新研究:推理模型能否准确表达其推理过程?我们的新论文表明它们不能。这对监控思维链(CoT)是否足以可靠捕捉安全问题提出了质疑。 动态Anthropic2025-04-03原文 打开互动版