动态

用vibe code将旧数据集转为VLM可用格式

用vibe code将旧数据集转为VLM可用格式
Daniel van Strien
你可以直接vibe code,让旧数据集在@huggingface上重获新生!

受@khoomeik's Samhitika启发,我将一个梵文OCR地面真值XML数据集转换为图像→文本对——为现代基于VLM的OCR做好准备。

只花了大约15分钟。

让我们多做这类事情吧
Rohan Pandey
最大的梵文文本语料库只有5亿个token。GPT-2使用了50倍于此的数据。

如果我们OCR大量文档,我们可以得到一个GPT-2大小的梵文语料库,但首先需要引导一个VLM来做OCR!

怎么做?合成数据。宣布Samhitika-0.0.1📜:BookCorpus的翻译版本。
动态Daniel van Strien2025-05-22原文

相关内容