陈丹琦团队发布 QUEEN:4B 参数模型兼顾棋力与自然语言讲解
国际象棋引擎下得好但说不清,语言模型会说但下不好,这篇论文用一个 4B 模型把两端接了起来,是「专业能力 + 自然语言解释」融合的一次具体尝试。
普林斯顿大学陈丹琦团队训练了一个叫 QUEEN 的模型,总参数量约 4B,棋力接近典型特级大师,还能用自然语言解释自己为什么走这一步。做法是把一个不说话的国际象棋引擎(Leela 的 BT5 网络)和一个通用语言模型(SmolLM3-3B)用门控交叉注意力桥接起来,再通过迭代搜索蒸馏对其自举提升。
正文摘录
.jpg) 编辑|Panda 9 月 27 日,第 46 届国际象棋奥林匹克团体赛在撒马尔罕落幕。东道主乌兹别克斯坦在最后一轮以 2.5 比 1.5 击败乌克兰,第二次捧起公开组金牌,中国女队则第七次登上女子组最高领奖台。下一场焦点大战也近在眼前:11 月底,两位 20 岁的棋手古克什(Gukesh D)与辛达罗夫(Javokhir Sindarov)将在日内瓦争夺世界冠军头衔,这将是史上最年轻的一场世界冠军对决。 看过近几年顶级棋赛直播的人,大概都熟悉画面一侧那根上下浮动的评估条。引擎会告诉你此刻白方领先半个兵,或者某步棋让胜率一落千丈,但它从不解释原因——这仍要靠坐在解说席上的特级大师。  棋盘最左边那根黑白相间、上下浮动的竖条就是评估条 这其实是 AI 领域一个普遍困境的缩影。最强的专家模型往往是沉默的,而最会说话的语言模型,在专业领域里又常常不够强。国际象棋引擎早已把人类远远甩在身后,却说不出一句人话。前沿大模型能写出头头是道的分析,可它推荐的着法本身未必站得住,解释也就成了无本之木。 近日,普林斯顿大学陈丹琦团队在 arXiv 发布了一项成果,尝试把这两端接起来。