行业新闻

清华微软联合提出STAR-PólyaMath多智能体推理系统,数学竞赛超越GPT-5.5

STAR-PólyaMath通过多智能体协调实现模型推理的元认知监督,解决了大模型在复杂数学问题上难以自我纠正的根本瓶颈。

当前大模型在长程数学推理中常沿错误方向空转,缺乏“知道自己卡在哪”的元认知。清华大学与微软亚洲研究院提出STAR-PólyaMath,通过Reasoner、Verifier、Meta-Strategist三个智能体循环协作,使推理可验证、可回溯,并在八大顶级数学竞赛中取得最优成绩,Apex基准超GPT-5.5达13.5%。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/bf312a1a-be5b-48c6-af10-d1ada6ab568f/0-2026-06-24T183305(2).641.jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 被一道数学竞赛题卡住很久时,高手往往能准确地判断:现在缺的是一个技术细节,还是整个思路从一开始就走错了?在回顾自己的探索和进展时,他们不断地评估哪些步骤已经通过验证,哪些命题存在缺陷,甚至凭直觉就能意识到哪些假设不可行;然后决定继续深挖,还是彻底转向一条全新的路径。知道自己卡在哪里、又该在何时推倒重来,是人类解决困难问题时极其关键的元认知能力。 而这恰恰是当前最强大语言模型仍难以稳定具备的能力。它们会沿着一条看似合理的路线不断补充细节、修饰论证,写出局部自洽、甚至颇具说服力的推导;但模型往往缺乏可靠的机制去识别「这不是一个需要继续打磨的解法,而是一条死路」。模型很难通过自我纠正跳出根本性错误的推理方向,而且缺乏像人类一样「从错误中学习」的主动意识。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-24原文

相关内容