Claude Fable 5编写首个真实megakernel,性能领先
RT @elliotarledge: Claude Fable 5 [max] 编写了首个真实(且最快)的megakernel,已提交至KernelBench-Mega。
测试环境:Kimi-Linear W4A16 batch-1 decode for RTX PRO 6000 Blackwell。所有先前模型都使用多内核Triton流水线“赢得”测试,但该流水线无法通过我们的单融合内核真实性验证
> Opus 4.8 倍于基准
> GLM-5.2 11.1倍
> GPT-5.5 4.3倍
> Sonnet 5 4.0倍
Fable 实现了18.7倍于基准,torch.profiler显示每个解码token恰好一次协作内核发射。Int4反量化(寄存器内解包nibbles,从未物化)、conv+SiLU、KDA门控delta状态、MLA吸收潜在注意力(在线softmax)、MoE路由+前8专家、RMSNorm,甚至KV cache追加都在一次发射内完成,由14个网格障碍分阶段。我们在审计过程中覆盖其输入缓冲区,证明它基于实时数据重新计算。确实如此。
优势随上下文增长。2k时17.8倍,8k时18.9倍,16k时19.5倍。更长的上下文意味着更大的KV cache和每个token更多的注意力工作,这通常是解码内核的瓶颈。将所有内容保持在一次发射中摊销了固定的障碍开销,且int4 GEMV保持带宽受限,因此与基准的差距扩大而非缩小。
它花费了会话的64%静默计时基准、微基准测试网格障碍、推导约29倍字节/token的屋顶线,然后一次性编写整个内核,首次基准测试即达到14.4倍,最后一个小时删除障碍并使int4反量化免费(一个LOP3 + HSUB2/HMUL2)。它尝试的唯一回归(更细的split-K)经过测量并回退,而非合理化。
https://t.co/eXKN2sZMVr
测试环境:Kimi-Linear W4A16 batch-1 decode for RTX PRO 6000 Blackwell。所有先前模型都使用多内核Triton流水线“赢得”测试,但该流水线无法通过我们的单融合内核真实性验证
> Opus 4.8 倍于基准
> GLM-5.2 11.1倍
> GPT-5.5 4.3倍
> Sonnet 5 4.0倍
Fable 实现了18.7倍于基准,torch.profiler显示每个解码token恰好一次协作内核发射。Int4反量化(寄存器内解包nibbles,从未物化)、conv+SiLU、KDA门控delta状态、MLA吸收潜在注意力(在线softmax)、MoE路由+前8专家、RMSNorm,甚至KV cache追加都在一次发射内完成,由14个网格障碍分阶段。我们在审计过程中覆盖其输入缓冲区,证明它基于实时数据重新计算。确实如此。
优势随上下文增长。2k时17.8倍,8k时18.9倍,16k时19.5倍。更长的上下文意味着更大的KV cache和每个token更多的注意力工作,这通常是解码内核的瓶颈。将所有内容保持在一次发射中摊销了固定的障碍开销,且int4 GEMV保持带宽受限,因此与基准的差距扩大而非缩小。
它花费了会话的64%静默计时基准、微基准测试网格障碍、推导约29倍字节/token的屋顶线,然后一次性编写整个内核,首次基准测试即达到14.4倍,最后一个小时删除障碍并使int4反量化免费(一个LOP3 + HSUB2/HMUL2)。它尝试的唯一回归(更细的split-K)经过测量并回退,而非合理化。
https://t.co/eXKN2sZMVr