动态

Transformer学习乘法受限于长期依赖,新研究提出改进方法。

Transformer学习乘法受限于长期依赖,新研究提出改进方法。
Rohan Paul
障碍是长期依赖,模型必须链接许多相隔很远的数字才能写出每个答案数字。
工作模型在每个位置保持一个运行总和,使其能够选择数字并将进位传递到后面的步骤。
它通过一种类似小型二叉树的注意力机制来构建,将成对数字的乘积存储在前面的令牌中,并在需要时拉回。
在一个注意力头内部,两个数字的乘积看起来像是相加它们的特征向量,因此保存配对信息很容易。
数字本身以五棱柱形状的模式排列,使用一种短傅里叶式编码,将偶数和奇数分开。
没有这些部件,标准训练会先学习边缘数字,然后在中间停滞,但一个预测运行总和的小型注意力头提供了完成训练所需的偏差。
---

论文 – arxiv.org/abs/2510.00184

论文标题: “为什么Transformer无法学习乘法?逆向工程揭示长期依赖陷阱”
动态Rohan Paul2025-10-04原文

相关内容