Yann LeCun分享预训练对齐度量论文,引用陶哲轩评LLM缺乏理论。
我们开始拥有预训练设置与评估性能之间可证明的对齐度量:
- CV
https://arxiv.org/abs/2402.11337
- CV +噪声:
https://arxiv.org/abs/2505.12477
- MAE
https://arxiv.org/abs/2508.15404
- JEPA
https://arxiv.org/abs/2205.11508
- LLM/NLP:
https://arxiv.org/abs/2505.17169
非常早期但有前景!
- CV
https://arxiv.org/abs/2402.11337
- CV +噪声:
https://arxiv.org/abs/2505.12477
- MAE
https://arxiv.org/abs/2508.15404
- JEPA
https://arxiv.org/abs/2205.11508
- LLM/NLP:
https://arxiv.org/abs/2505.17169
非常早期但有前景!
数学家Terence Tao:
训练和运行LLM在数学上并不困难;任何数学本科生都能理解基础
神秘之处在于我们没有理论来预测为什么模型在某些任务上表现出色而在其他任务上失败
“我们只能进行经验实验” https://t.co/wQ5NDhudHr