动态

Google新论文揭示推理模型通过内部模拟多智能体交互提升能力。

Google新论文揭示推理模型通过内部模拟多智能体交互提升能力。
elvis
Google这篇新论文有一个有趣的发现。

在复杂任务上,推理模型优于指令微调模型。

常见的解释是,通过更长的思维链实现了扩展的测试时计算。

但这项新研究揭示了更深层的东西。

它表明,增强的推理能力源于模型内部隐式模拟的多智能体类交互。

研究人员称之为“思想社会”。

通过对DeepSeek-R1和QwQ-32B推理轨迹的定量分析,他们发现这些模型表现出比基线模型大得多的视角多样性。

它们在推理过程中激活了异质个性和专业知识相关特征之间更广泛的冲突。

这看起来像什么?

对话行为包括问答序列、视角转换、观点冲突以及分歧调和。

模型与自己辩论,采用不同的社会情感角色,形成尖锐的来回对话。

与DeepSeek-V3相比,DeepSeek-R1表现出显著更多的问答、视角转换和调和。QwQ-32B与Qwen-2.5-32B-IT相比也有相同模式。指令微调模型产生单向独白。推理模型产生模拟对话。

成功的推理模型避免了导致错误答案的“回音室”。通过模拟不同视角的分歧,它们防止了对误导性初始主张的盲从。

受控强化学习实验表明,当仅因推理准确性获得奖励时,基础模型会自发发展出对话行为。

使用对话脚手架微调的模型比使用独白式推理微调的模型学习更快,尤其是在训练早期阶段。

这项研究表明,推理能力可能与其说是扩展计算,不如说是有意多样化和辩论内部认知视角。

论文:
https://
arxiv.org/abs/2601.10825

在我们的学院中学习构建有效的AI代理:
https://
dair-ai.thinkific.com
动态elvis2026-01-24原文

相关内容