會下棋也會講解的語言模型:Queen 的 4B 國際象棋專家

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Queen 是一個 4B 參數的國際象棋語言模型,能在講解自己著法與計畫的同時,達到典型特級大師的棋力。它透過交叉注意力把沉默的專家棋盤編碼器接入指令微調語言模型,用問答課程提取棋類概念,再以 Bellman 更新的自然語言類比做迭代蒸餾:分析候選著法之後的局面,歸併成當前局面的解釋,並蒸餾回模型。七輪迭代後 Elo 由 1782 升至 2697,據論文稱在棋力與謎題準確率上超過所有前沿模型,參數量少三個數量級。

技术背景与问题定义

现代国际象棋引擎是"沉默的专家"。它们的棋力早已远超人类,却无法说明自己为什么这样走。语言模型正好相反:它们能写出读起来很合理的解释,但自身棋力很弱,所以解释的参考价值有限。一个会下错棋的老师,讲得再流畅也不可信。

这篇论文(arXiv:2610.03695v1,作者 Adithya Bhaskar、Jeffrey Cheng、Danqi Chen,类别 cs.CL)要解决的就是这个矛盾:能不能让同一个模型既下得好,又讲得清。作者给出的答案叫 Queen,一个 4B(40 亿)参数的"国际象棋语言模型"。按摘要,它在讲解自己的着法和计划的同时,棋力达到典型特级大师的水平。

需要说明:本文只依据论文摘要写成。训练数据规模、评测对手、Elo 的测量协议等细节,摘要没有给出,下文不做猜测。

核心架构与原理解析

Queen 由两个互补的部分组成:一个编码器-解码器架构,和一个迭代蒸馏算法。 第一部分是架构。作者把一个"沉默的专家棋盘编码器"与一个经过指令微调的语言模型,通过交叉注意力(cross-attention)连接起来。编码器负责理解局面,语言模型负责说话。交叉注意力让语言模型在生成每个词时都能读取编码器内部的表示。训练时采用问答课程(question-answering curriculum):模型被要求回答关于局面的问题,从而学会从编码器的表示里提取棋类概念,例如子力关系、威胁和战术主题。

第二部分是迭代蒸馏。作者称之为 Bellman 更新的"自然语言类比"。在强化学习里,Bellman 更新用后继状态的价值来修正当前状态的价值。Queen 的做法是:先分析自己排名靠前的几个候选着法之后的局面,再把这些分析归并成对当前局面的解释,最后把这份解释蒸馏回模型本身。换句话说,向前看几步得到的结论,被写成文字,再变成模型下一轮的训练信号。这样,模型不需要在每次推理时都展开搜索,就能把搜索得到的信息内化。 摘要报告:经过七轮迭代,模型增长超过 900 Elo 分,从 1782 升到 2697。

关键功能与实战评估

摘要给出的主要数字有三项。 第一,棋力。Elo 从 1782 升到 2697,增幅超过 900。作者称这在下棋强度和谜题(puzzle)准确率两方面,都大幅超过所有前沿模型。 第二,规模。Queen 只有 4B 参数,比对比的前沿模型少三个数量级。这说明在这个领域,专用编码器加定向训练,比单纯堆参数更有效。 第三,解释质量。作者用语言模型做评估,认为 Queen 的解释流畅,在连贯性上接近 GPT-5.6-Sol(high)。 读者应注意的限制:一,解释的质量由语言模型打分,这衡量的是流畅与连贯,不等于解释忠实反映了模型真实的决策依据。二,"连贯性接近"只是一个维度,摘要没有声称在其他维度也持平。三,这是 v1 预印本,尚未经过同行评审。四,摘要没有说明消融实验的细节,所以无法判断编码器、问答课程和迭代蒸馏各自贡献了多少。

再看这个设计的取舍。把"看懂局面"和"说出来"拆给两个模块,好处是各取所长:引擎式的编码器擅长判断,语言模型擅长组织语言。代价是系统更复杂,训练要分阶段,而且解释的质量依赖编码器表示里确实包含了相关概念。问答课程的作用,正是检验并逼出这些概念。 迭代蒸馏的另一个特点是自举。每一轮的解释都由上一轮的模型生成,再回灌给模型。这类循环有放大错误的风险:如果某一轮的分析有系统性偏差,后一轮可能把它当作事实学进去。摘要没有说明作者如何控制这类风险,也没有说明七轮之后增长是否已经趋于平缓。这些都是读全文时应当首先核对的地方。

行业影响与未来演进

作者认为这套架构和训练流程具有通用性:只要某个领域存在"沉默的专家编码器",就可以套用,例如游戏、机器人和计算机操作。这是一个有价值的设想,但目前只是作者的推断,摘要里只有国际象棋的证据。

对读者最有用的启示有两点。其一,"专家系统负责判断,语言模型负责表达"的分工,加上把搜索结论蒸馏回模型的循环,是一条可以复用的路线。其二,可解释性的评估仍是难点:流畅的解释不一定是真实的解释。后续工作需要检验解释与实际决策之间的因果一致性,并在棋类之外的领域复现这些结果,才能确认这个配方是否真的通用。

Sources

FAQ

Queen 的参数规模和棋力是多少?

据摘要,Queen 有 4B 参数,经七轮迭代 Elo 由 1782 升至 2697,增幅超过 900,棋力相当于典型特级大师。

Queen 的迭代蒸馏是怎么做的?

模型先分析自己排名靠前的候选着法之后的局面,再把这些分析归并成对当前局面的解释,最后把解释蒸馏回模型。作者称这是 Bellman 更新的自然语言类比。

语言模型和专家编码器如何连接?

通过交叉注意力把沉默的专家棋盘编码器接入指令微调语言模型,并用问答课程训练模型从编码器表示中提取棋类概念。