微信WeLM 617B MoE用Hidden Decoding实现隐式序列缩放
WeLM 617B MoE通过Hidden Decoding将思考折叠进序列,实现隐式序列缩放,以更低成本获得更优性能。
微信WeLM团队提出Hidden Decoding方法,将额外算力折叠进序列内部,让模型在token之间完成隐式思考,输出不变长但每个token想得更深。团队将此方法扩展到617B MoE模型,增量续训仅用完整训练量的5.3%,在9个评测中全部超越自回归基线。这是继参数缩放和思维链之后的第三条道路。
正文摘录
 新智元报道  大模型变强,过去靠两条路。 做大——Scaling Law 出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1 带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了 Scaling 参数和思维链之外,到底有没有第三条路?  微信 WeLM 团队给了一个全新的答案—— 把额外算力折叠进序列内部,让模型在 token 之间完成隐式思考。输出不变长,每个 token 想得更深。 这套方法叫 Hidden Decoding,隐式序列缩放。 而 WeLM 做到的关键一步,是把它推到了前沿规模。 从 3 月的 80B 参数,到现在的 617B MoE,不仅增量续训只用了完整训练量的 5.3%,而且 9 个评测全部超越自回归基线。