提出密集预测损失,改进特征学习 Loren我们的解决方案?将预测损失应用于所有token:掩码和可见的。这种“密集预测损失”迫使上下文token编码细粒度的局部信息,产生空间结构化、语义一致的特征。 动态Loren2026-03-20原文 打开互动版