用vibe code将旧数据集转为VLM可用格式
你可以直接vibe code,让旧数据集在@huggingface上重获新生!
受@khoomeik's Samhitika启发,我将一个梵文OCR地面真值XML数据集转换为图像→文本对——为现代基于VLM的OCR做好准备。
只花了大约15分钟。
让我们多做这类事情吧
受@khoomeik's Samhitika启发,我将一个梵文OCR地面真值XML数据集转换为图像→文本对——为现代基于VLM的OCR做好准备。
只花了大约15分钟。
让我们多做这类事情吧
最大的梵文文本语料库只有5亿个token。GPT-2使用了50倍于此的数据。
如果我们OCR大量文档,我们可以得到一个GPT-2大小的梵文语料库,但首先需要引导一个VLM来做OCR!
怎么做?合成数据。宣布Samhitika-0.0.1📜:BookCorpus的翻译版本。