腾讯发布STEPQuant:6-bit状态达FP32精度,服务内存降68.7%
RT @HuggingPapers:腾讯研究人员刚刚在 Hugging Face 上发布了 STEPQuant
一个面向 Delta-rule 循环状态的空间-时间后训练量化框架,以 6-bit 状态达到 FP32 精度,同时将总服务内存降低最多 68.7% https://t.co/ilVY2w5tVm
一个面向 Delta-rule 循环状态的空间-时间后训练量化框架,以 6-bit 状态达到 FP32 精度,同时将总服务内存降低最多 68.7% https://t.co/ilVY2w5tVm