LeCun新论文用SIGReg解决表征坍缩,小模型高效编码物理规律
全网都在吹的LeCun新论文,90%的解读都是错的。
他们说生成式AI是死路,说过去三年花的几百亿全白费了,说15M参数的小模型就能吊打万亿大模型。
这些全是营销号的夸张,
我觉得这篇论文的真正分量比他们吹的还要重。
Yann LeCun团队这次解决了JEPA困扰了好几年的表征坍缩问题。
以前的世界模型,学着学着就会把狗车人都压成一模一样的向量,什么都学不到。
这次他们只加了一个极其优雅的数学正则化器SIGReg,
没有复杂的trick 和六个超参数要调,训练稳得离谱。
单张GPU几个小时就能训完,在机器人控制任务上,规划速度比巨型世界模型快48倍,成功率还更高。
最厉害的是它的隐空间里天然就编码了物理规律。
不用教,它自己就知道物体不能瞬移,知道速度和位置的关系。
能瞬间检测出物理上不可能发生的事。
这不是啥范式革命,也不会让GPT和Claude明天就死掉。
语言和创意生成,依然是自回归大模型的天下。
但它打开了一扇全新的门,
原来懂物理不需要万亿参数,不需要云端超算。
原来世界模型可以小到跑在机器人的本地芯片上。
过去三年,整个行业都在一条路上狂奔,堆参数,堆算力,堆数据。
所有人都以为只要足够大,就能懂世界。
现在我们终于知道,还有另一条路,一条更高效,更优雅,更接近真实世界运行方式的路。
生成式AI不会死,
但未来的智能体不会是只会聊天的大模型,
它会是一个懂物理的小世界模型,加一个大语言接口,
这才是这篇论文真正的意义所在吧 hhh
他们说生成式AI是死路,说过去三年花的几百亿全白费了,说15M参数的小模型就能吊打万亿大模型。
这些全是营销号的夸张,
我觉得这篇论文的真正分量比他们吹的还要重。
Yann LeCun团队这次解决了JEPA困扰了好几年的表征坍缩问题。
以前的世界模型,学着学着就会把狗车人都压成一模一样的向量,什么都学不到。
这次他们只加了一个极其优雅的数学正则化器SIGReg,
没有复杂的trick 和六个超参数要调,训练稳得离谱。
单张GPU几个小时就能训完,在机器人控制任务上,规划速度比巨型世界模型快48倍,成功率还更高。
最厉害的是它的隐空间里天然就编码了物理规律。
不用教,它自己就知道物体不能瞬移,知道速度和位置的关系。
能瞬间检测出物理上不可能发生的事。
这不是啥范式革命,也不会让GPT和Claude明天就死掉。
语言和创意生成,依然是自回归大模型的天下。
但它打开了一扇全新的门,
原来懂物理不需要万亿参数,不需要云端超算。
原来世界模型可以小到跑在机器人的本地芯片上。
过去三年,整个行业都在一条路上狂奔,堆参数,堆算力,堆数据。
所有人都以为只要足够大,就能懂世界。
现在我们终于知道,还有另一条路,一条更高效,更优雅,更接近真实世界运行方式的路。
生成式AI不会死,
但未来的智能体不会是只会聊天的大模型,
它会是一个懂物理的小世界模型,加一个大语言接口,
这才是这篇论文真正的意义所在吧 hhh
这可能是今年AI圈最清醒的一条推文,
Yann LeCun 是当今 AI 领域最有影响力的科学家之一,深度学习三大教父之一,2018 年图灵奖获得者,
他直接怼了Anthropic CEO Dario的著名言论,
Dario说未来一到五年,一半的科技法律咨询金融岗位会被彻底干掉。 https://t.co/iWSbZuXOuo