新模型VAETKI 112B,10B活跃参数,使用开放数据集训练
还有...另一个...
VAETKI 112B总参数量,10B活跃参数,他们使用带有SWA(512 token窗口)的MLA,在约10T token上训练,并且只使用开放数据集!!
VAETKI 112B总参数量,10B活跃参数,他们使用带有SWA(512 token窗口)的MLA,在约10T token上训练,并且只使用开放数据集!!
还有一个!!韩国开放MOE模型下起来了
102B,12B活跃参数,在19.7T token上训练,这训练量很大 https://t.co/uZF4v3R02y