RLVR 需清洗数据和对齐奖励函数,最终得到 SOTA 模型 Thinking Machines清洗数据和对齐 RLVR 的奖励函数需要专业知识和前期投入,但最终会得到在复杂任务上达到最先进水平的模型。UIUC 和 Bridgewater 的研究人员与我们的团队合作撰写的客座文章。https://t.co/1UHTXFcZnW 动态Thinking Machines2026-08-27原文 打开互动版