EBT模型在预训练和推理时超越Transformer++
我们如何解锁通用推理?
⚡️介绍能量基Transformer(EBT),一种在预训练中超越(前馈)Transformer的方法,并在任何模态/问题上实现无需奖励的通用推理/思考。
TLDR:
- EBT是首个在预训练中跨模态以及相对于数据、参数、FLOPs、深度等维度超越Transformer++的模型
- EBT通过更长的思考时间在测试时实现比Transformer++提升29%的性能
- EBT在推理时展现出比现有模型更好的泛化能力
🧵线程:
⚡️介绍能量基Transformer(EBT),一种在预训练中超越(前馈)Transformer的方法,并在任何模态/问题上实现无需奖励的通用推理/思考。
TLDR:
- EBT是首个在预训练中跨模态以及相对于数据、参数、FLOPs、深度等维度超越Transformer++的模型
- EBT通过更长的思考时间在测试时实现比Transformer++提升29%的性能
- EBT在推理时展现出比现有模型更好的泛化能力
🧵线程: