论文提出隐式思维链解决Transformer乘法缺陷
一篇来自MIT、哈佛和Google DeepMind的精彩论文,解释了为什么Transformer会在多位乘法上出错,并展示了一个简单的偏置来修复它。研究人员在两个小型Transformer模型上训练了4位数乘以4位数的乘法。其中一个使用了名为隐式思维链(ICoT)的特殊训练方法,模型首先看到所有中间推理步骤,然后随着训练进行,这些步骤被慢慢移除。这迫使模型在内部“思考”,而不是依赖可见的步骤。该模型完美地学会了任务——它对每个示例都给出了正确答案(100%准确率)。另一个模型以标准微调的方式训练,只看到输入数字和最终答案,没有推理步骤。该模型几乎完全失败——只答对了大约1%的答案。也就是说,使用隐式思维链(ICoT)训练的模型在4x4乘法上达到了100%准确率,而正常训练根本无法学会。