动态

LLaMA-4预训练多语言数据未公开,但开源了FineWeb 2

LLaMA-4预训练多语言数据未公开,但开源了FineWeb 2
Hynek Kydlíček
LLaMA-4 在 100+ 种语言上进行了预训练,每种语言超过 10 亿 token… 但没有共享数据集。

幸运的是,我们构建了一个完全开源的数据集:FineWeb 2 — 覆盖数百种语言,规模相当。
Guilherme Penedo
像往常一样,我们对 🦙Llama 4 的预训练数据了解不多,但我们知道这些模型在超过 100 种语言、每种超过 10 亿 token 上进行了训练。

哪里能找到这么大数量的多语言数据?🥂FineWeb2,我们的大型多语言数据集,已经为你准备好了 👇 https://t.co/ttYy7RPmqJ
动态Hynek Kydlíček2025-04-06原文

相关内容