Subquadratic 用稀疏注意力消除长上下文二次方计算成本
Subquadratic 提出稀疏注意力,把长上下文处理成本从二次方降下来,推理加速 40 倍,让企业海量数据不必再靠昂贵清洗也能用上。
嘉宾Alexander Whedon
节目简介
标准注意力机制有个隐藏开销:上下文长度翻倍,计算量要涨四倍(这叫二次复杂度)。Subquadratic 的稀疏注意力能绕开它,在 100 万 token 长度下推理快 40 倍、计算量降到 1/64。他们还发现,编码 AI 代理 86% 的时间在做“读取”,也就是整理上下文,真正解题只占一小部分。