清华微软联合提出STAR-PólyaMath多智能体推理系统,数学竞赛超越GPT-5.5
STAR-PólyaMath通过多智能体协调实现模型推理的元认知监督,解决了大模型在复杂数学问题上难以自我纠正的根本瓶颈。
当前大模型在长程数学推理中常沿错误方向空转,缺乏“知道自己卡在哪”的元认知。清华大学与微软亚洲研究院提出STAR-PólyaMath,通过Reasoner、Verifier、Meta-Strategist三个智能体循环协作,使推理可验证、可回溯,并在八大顶级数学竞赛中取得最优成绩,Apex基准超GPT-5.5达13.5%。
正文摘录
.641.jpg)  被一道数学竞赛题卡住很久时,高手往往能准确地判断:现在缺的是一个技术细节,还是整个思路从一开始就走错了?在回顾自己的探索和进展时,他们不断地评估哪些步骤已经通过验证,哪些命题存在缺陷,甚至凭直觉就能意识到哪些假设不可行;然后决定继续深挖,还是彻底转向一条全新的路径。知道自己卡在哪里、又该在何时推倒重来,是人类解决困难问题时极其关键的元认知能力。 而这恰恰是当前最强大语言模型仍难以稳定具备的能力。它们会沿着一条看似合理的路线不断补充细节、修饰论证,写出局部自洽、甚至颇具说服力的推导;但模型往往缺乏可靠的机制去识别「这不是一个需要继续打磨的解法,而是一条死路」。模型很难通过自我纠正跳出根本性错误的推理方向,而且缺乏像人类一样「从错误中学习」的主动意识。