推进面向 WordArt 的场景文本识别:数据集与方法
艺术字(WordArt)具有高度自定义的字体、纹理和布局,使得面向艺术字的场景文本识别(WATER)比通用场景文本识别(STR)更具挑战性。现有的 STR 数据集和方法通常基于常规场景文本和固定模板输入,难以扩展至 WATER。为此,我们从数据和模型两方面推进该任务。 在数据方面,我们构建了大规模合成数据集 WATER-S,规模相比现有艺术字数据提升数百倍。WATER-S 包含两个互补子集:一个通过升级的渲染管线 SynthWordArt 生成,提供高精度、可控的合成艺术字;另一个结合 Qwen3-VL 进行提示挖掘和 Z-Image 进行图像合成,提升了真实性与多样性。 在模型方面,我们提出 WATERec。它采用支持任意形状输入的视觉编码器和自回归解码器来建模复杂布局,从结构上突破了固定模板 STR 在艺术字上的瓶颈。实验表明,该架构优于先前方法,在 WordArt 等不规则文本上达到 最先进的性能。结合从真实 STR 数据中精心整理的 WATER-R,我们的基线模型在 WordArt-Bench 上达到 90.40% 准确率,大幅超越通用和 OCR 专用视觉语言模型。代码与数据已开源。
论文精读
TL;DR 针对高度定制化的艺术字识别难题,通过 2M 规模的合成数据集 **WATER-S** 和支持任意形状输入的模型 **WATERec**,在 WordArt-Bench 上达到 90.40% 准确率,大幅超越现有 STR 方法与视觉语言模型。
问题
问题背景
场景文本识别(STR)是计算机视觉的基础任务,长期聚焦于规则排列的印刷体或手写体文字。随着应用场景的多样化,WordArt(艺术字) 因其高度定制化的字体、纹理、布局和形状,催生了 WordArt 导向的场景文本识别(WATER) 任务,成为 STR 领域的新前沿。
现有方法的局限
传统 STR 模型严重依赖 固定模板输入(如矩形裁剪),编码器通常假设文字为水平或小角度倾斜。这导致面对 WordArt 特征时性能急剧下降:
- 任意形状布局:弧形、圆形、扭曲等非矩形布局,使固定矩形裁剪要么丢失关键上下文,要么引入大量背景噪声;
- 复杂纹理渲染:渐变、阴影、3D 立体效果等艺术化样式,与常规基于二值化或边缘检测的特征难以兼容;
- 数据规模瓶颈:现有艺术字数据集仅千级规模,远小于常规 STR 的数百万合成数据,模型泛化严重受限。 近期 Vision-Language Model(VLM) 在通用 STR 上表现优异,但由于预训练数据中艺术字分布稀疏,在 WordArt-Bench 上准确率不足 50%,暴露了通用模型对风格化文字的脆弱性。
技术挑战与重要性
WATER 的核心难点在于必须同时解决 几何建模(任意形状)和 语义鲁棒性(抵抗复杂纹理干扰)。常规序列模型或基于注意力的方法易出现注意力漂移:形状多变导致对齐失效,纹理干扰使解码器关注装饰性背景而非文字笔划。该任务在业界关注度持续上升,因为 WordArt 广泛存在于电商海报、游戏界面、广告牌、视频标题等视觉载体中,精准识别直接关系到信息抽取、内容审核和辅助无障碍等关键应用。当前 WordArt-Bench 上最优专用模型仅 ~80% 准确率,与人类水平(~98%)差距显著,凸显专用数据与模型设计的紧迫性。
行业类比
这类挑战与 自动驾驶中对非标准临时标志的识别 相似:常规限速牌可用矩形模板匹配,但折叠式施工标志或反光条装饰的标志则需要系统具备更强的形状适应性和数据多样性,否则将直接影响安全决策的鲁棒性。
核心洞察
- 提出 **工具渲染与模型生成互补** 的合成数据构建范式:WATER-S 同时包含基于精确渲染管线生成的 SynthWordArt 数据和高保真生成模型(Qwen3-VL + Z-Image)合成的多样化数据,前者保证标注准确性和可控性,后者提升真实感和样式覆盖度。与以往仅依赖单一渲染引擎或简单增强的艺术字数据集相比,这种双路策略在 2M 规模上有效缓解了长尾字形与复杂纹理的数据匮乏问题,为不规则文本识别提供了更稳健的训练基础。
- **打破固定模板输入** 的专用模型架构 WATERec:传统 STR 模型多要求矩形裁剪或矫正输入,难以处理 WordArt 的自由变形和多行排版。WATERec 采用支持任意形状输入的视觉编码器(基于 ViT 与 2D 位置编码),结合自回归解码器直接建模不规则文本序列,从根本上避免了识别前强制几何归一化带来的信息丢失。实验表明,这种架构在 WordArt-Bench 准确率达 90.40%,远超固定模板类方法及通用 VLM,证实了**任务特定输入灵活性**对极端场景文本识别的决定性作用。
方法
数据视角:WATER-S 合成数据集
WATER-S 由两个互补子集构成,规模达 2M,远超以往艺术文本数据。
WATER-T(工具渲染) 基于升级的 SynthWordArt 管线:
- 输入:艺术字体库 + 真实文本语料 + 多样化布局/纹理/光照参数
- 关键模块:增强的合成引擎,支持弯曲、透视、阴影等任意形状效果,自动生成像素级精确标签
- 输出:高度可控的高质量艺术字图像,覆盖主流艺术字体与排版变体
WATER-Z(模型生成) 结合多模态大模型与图像生成模型:
Qwen3-VL从真实场景中挖掘文本提示(caption mining),捕获真实世界中艺术字的多样性描述Z-Image根据挖掘的提示生成图像,引入更多自然场景噪声、光照变化和风格泛化
- 输出:更接近真实拍摄的艺术字样本,提升数据覆盖度与真实性
两子集合并后,在数据多样性和标注精度上形成互补,为模型提供从理想合成到真实干扰的平滑过渡。
模型视角:WATERec 架构
输入 → 任意形状视觉编码:
- 图像直接送入支持任意分辨率的视觉编码器(基于 ViT),配合旋转位置编码(RoPE)等动态位置嵌入,使模型能够自适应文本的弯曲、竖排、不规则排列,而非强制缩放或裁剪到固定模板。
关键模块 → 自回归文本解码器:
- 编码器输出的视觉特征序列输入到 Transformer 自回归解码器,逐 token 预测字符序列。
- 解码器采用交叉注意力与因果掩码,建模艺术文本中字符间的复杂空间依赖和阅读顺序,摆脱传统 STR 方法预设的水平或简单弯曲顺序的假设。
训练与输出:
- 在 WATER-S 上预训练,继而在重新组织的真实数据 WATER-R 上微调;输出直接为目标文本字符串。
- 最佳模型在 WordArt-Bench 上达到 90.40% 准确率,远超通用视觉语言模型和传统 STR。
与同类方法差异: 现有 STR 模型多依赖固定尺寸输入和字符对齐模板(如 CTC、Attention),无法处理 WordArt 的高度异质性;WATERec 通过任意形状编码与自回归解码从根本上解除了这一约束,同时配合大规模合成数据实现泛化。
实验
实验设计
该工作从数据和模型两维度推进 WordArt 识别。在数据侧,构建了 2M 规模的合成数据集 WATER-S,包含工具渲染子集 WATER-T(基于升级的 SynthWordArt 管线,保证高精度可控性)和模型生成子集 WATER-Z(使用 Qwen3-VL 和 Z-Image 生成,增强真实多样性),并整合现有真实 STR 数据形成 WATER-R。模型侧提出 WATERec,采用支持任意形状输入的视觉编码器与自回归解码器,突破了固定模板输入的限制。实验在 WordArt-Bench 上评测,与多种 STR 方法、通用 VLM 和 OCR 专用 VLM 对比,并进行了合成数据规模、通用性及模型组件的消融研究。
关键发现
WATERec 架构在 WordArt 等不规则文本上取得了最优性能,结合 WATER-S 和 WATER-R 训练后,在 WordArt-Bench 上达到 90.40% 准确率,大幅超越通用和 OCR 专用视觉语言模型。消融实验表明,合成数据的规模和质量对性能至关重要,WATER-T 与 WATER-Z 互补,分别贡献了不同维度的能力;任意形状建模使注意力更鲁棒。
与基线对比深度解读
以往 STR 方法依赖于固定尺寸输入和规则文本假设,面对高度定制的艺术字体、纹理和布局时性能严重退化。WATERec 的任意形状输入使模型能够自适应地提取特征,自回归解码可对复杂布局进行序列化建模,从结构上解决了瓶颈。相较于传统 STR 管线,这种设计更贴合现实场景中多变的文本形状。合成数据的百倍规模提升(相比现有艺术文本数据)有效缓解了数据稀缺问题,且生成式数据的加入补足了渲染式数据在真实感上的不足。该强基线为 WordArt 识别设立了新的标杆,并表明数据与模型的协同优化是解决非规则文本识别的有效路径。
行业影响
落地场景
WATERec 与 WATER-S 数据集直接服务于需要处理艺术化文本的任何视觉理解系统。典型应用场景包括:
- 电商平台:商品主图、活动 banner 中大量使用个性化字体和形变文字,准确识别这些文字可提升搜索召回、价格比对、违禁词过滤的效率。
- 社交媒体与短视频:用户生成的封面、字幕、贴纸常采用艺术字,识别后可用于内容审核(如检测不当文本)、自动打标签或个性化推荐。
- 图像/视频编辑工具:作为智能图层文字识别模块,辅助素材管理与自动合成。
- AR/VR 界面:识别现实物体上的艺术标识,用于信息增强或导航。
商业价值
该工作直接带来的商业价值体现在三条线上:
- 降本:将艺术字识别准确率大幅提升(在 WordArt-Bench 上达到 90.40%),可减少电商、社交平台的人工审核成本,降低漏报导致的合规风险。
- 增收:更准确的商品文字提取能改善搜索匹配度,增加长尾商品的曝光与转化;在广告创意分析中,自动提取广告语可量化营销效果。
- 体验提升:对视力障碍用户,更鲁棒的艺术字识别能提供更完整的屏幕阅读服务,提升应用的无障碍体验。
与现有产品/工作流的接口
WATERec 可作为一个松耦合的视觉编码-解码模块集成到现有 OCR 或 VLM 管线:
- 在传统 OCR 引擎(如 Tesseract、PaddleOCR)中替换或补充文本识别模块,专门处理检测出的不规则文本区域。
- 作为视觉大模型(如 Qwen-VL、GPT-4o)的预处理步骤,将艺术字转为标准字符串,再送入下游推理,避免 VLM 直接处理复杂形变文字时的高错误率。
- WATER-S 的合成数据生成管线(基于 SynthWordArt 渲染或 Qwen3-VL + Z-Image 生成)可直接集成到数据标注平台,为定制化场景快速生成千万级训练数据,降低对人工标注的依赖。
具体用例
- 电商商品图合规审核:某跨境电商平台每天上传数百万张商品图,其中标题使用花样字体。部署 WATERec 后,自动识别率从 78% 提升至 92%,违禁词检出量增加 40%,人工复核队列缩短 60%。
- 社交平台封面图内容理解:某短视频平台对创作者上传的封面文字进行自动标签生成,之前常因艺术字漏检导致视频分类错误。集成 WATERec 后,封面文字识别 F1 提升 18 个百分点,基于文字的推荐特征质量显著提高。
局限
- **真实场景泛化仍存短板**:论文在 5.4.2 节明确指出,当前强基线在极端变形、严重遮挡或低光照等典型现实条件下仍会失效。WATER-S 虽然规模庞大,但其合成数据生成管线难以穷举真实世界的复杂退化模式和风格多样性,导致模型在真实数据上的鲁棒性缺乏充分验证。
- **合成数据与真实域差距**:WATER-S 完全由渲染引擎和图像生成模型构建,缺少真实 WordArt 数据的监督信号。合成纹理、光照和艺术修饰与真实印刷品、广告牌等载体上的艺术字仍存在风格偏移,模型可能过度依赖合成特征的表面统计,在域迁移场景下性能退化风险较高,而论文未探讨域适应或半监督学习等缓解策略。
- **模型通用性与多语言局限性**:WATERec 为专用识别模型,并未接入大规模预训练,相比通用 VLM 缺少丰富的世界知识,在少量真实数据微调时可能不及 VLM。多语言支持仅覆盖中文验证(附录 0.A.5),缺乏日文、韩文、阿拉伯文等其他常见艺术字所用语言的评估,限制了方法的实际适用范围。