LeCun 分析 LLM 表面语义强但细节空洞,因过度压缩
你想知道为什么 LLM 在表面语义上感觉敏锐,但在细节上却显得空洞吗?
“从 Token 到思想:LLM 和人类如何用压缩换取意义”
明天来 #ICLR2026 海报展吧——4月24日周五,太平洋夏令时上午6:30–9:00(当地时间上午10:30!),3号展馆,P3-#1017,答案揭晓!
我们认为这是因为它们过度压缩了。人类因细微差别而保留“低效”的概念。LLM 为了更干净、信息论意义上的压缩而丢弃了这些。不同的目标导致不同的表征。
使用信息瓶颈视角跨越40多个模型,我们还发现编码器比大它们许多倍的解码器更接近人类,并且在训练过程中,随着模型发现更稀疏的编码,语义处理从深层迁移到中层。
“从 Token 到思想:LLM 和人类如何用压缩换取意义”
明天来 #ICLR2026 海报展吧——4月24日周五,太平洋夏令时上午6:30–9:00(当地时间上午10:30!),3号展馆,P3-#1017,答案揭晓!
我们认为这是因为它们过度压缩了。人类因细微差别而保留“低效”的概念。LLM 为了更干净、信息论意义上的压缩而丢弃了这些。不同的目标导致不同的表征。
使用信息瓶颈视角跨越40多个模型,我们还发现编码器比大它们许多倍的解码器更接近人类,并且在训练过程中,随着模型发现更稀疏的编码,语义处理从深层迁移到中层。