论文

UltraText Bench:评估图像生成中视觉文本渲染的综合双语基准

UltraText Bench:评估图像生成中视觉文本渲染的综合双语基准

密集视觉文本要求图像生成器在多个区域复现长字符串,且位置正确、清晰可读。随着短字符串渲染能力不断提升,评测必须进一步检验模型在更苛刻场景下的持续表现。 我们提出 UltraText Bench,一个面向纯 prompt 生成密集视觉文本的双语基准,涵盖 24 个真实场景类别与三个难度等级,共 432 条 prompt,中英文各占一半。每条 prompt 均经人工审核,为 4 至 12 个文本区域给出精确字符串,并配以描述其内容、位置与视觉属性的结构化参考。 评测采用 Q-Judger 视觉语言模型,将生成图像与完整参考对比,报告 文本保真度、文本清晰度、空间质量 与 场景质量 四项指标。在 24 种模型配置上,各维度呈现出不同侧重: - Z-Image-Turbo 相比 Z-Image-Base 在清晰度上提升 3.81 分,保真度却下降 14.76 分(上述设置下); - 性能还随任务负载变化,Qwen-Image-2512 的英文综合分从 L1 的 86.50 降至 L3 的 42.86。 此外,10 名参与者参与了自动评分的人工评估。仓库地址:https://github.com/LINs-lab/UltraTextBench。

论文精读

TL;DR UltraText Bench 构建了 432 条中英双语密集视觉文本提示与结构化区域参考,以四维评分揭示图像生成模型在长字符串布局与清晰度上的能力差异。

问题

问题背景: 当前文本到图像生成模型在渲染短字符串(如单词、短语)方面已取得明显进展,但真实场景中的海报、文档、UI 常包含多个区域的密集长文本,要求模型同时保持内容正确、位置准确且清晰可读。

现有方法局限: 主流基准如 DrawBench、T2I-CompBench 等主要考察单区域短文本,或仅用 OCR 指标评估有无文字,不提供逐区域的结构化参考(字符串、位置、字体、颜色等)。这导致:

  • 无法区分模型是否进行精确的文本复制,还是仅生成语义相似文字;
  • 无法评估跨多区域的空间布局和排版一致性;
  • 缺少双语(中英文)测试,难以反映真实多语言场景;
  • VLM 自动评测的可靠性缺乏大规模人类验证。

为什么难/重要: 密集文本渲染要求模型在自回归或扩散过程中同时规划多个文本 token 序列及对应的空间锚点,序列长度和区域数量增加会显著放大错误累积。不同模型在文本保真度与清晰度之间往往存在 trade-off(如 Z-Image-Turbo 清晰度提升但保真度下降),需要细粒度指标才能区分。业界对海报生成、文档自动化、UI 设计等应用有直接需求,评估基准必须与模型能力同步升级。

行业类比: 这与自动驾驶感知从单一目标检测转向复杂城市场景多目标跟踪类似,模型能力提升后,评测标准也必须转向更细粒度、多约束的场景,否则无法指导优化方向。

核心洞察

  • 该基准将评估焦点从短字符串渲染转向密集多区域长文本生成,要求模型在单张图像中准确生成 4-12 个文本区域的精确字符串与布局。相较于仅测试单词或单行文本的现有基准,它暴露了模型在持续渲染压力下的能力衰退——例如 Qwen-Image-2512 在难度从 L1 到 L3 时 English 综合得分从 86.50 骤降至 42.86,揭示模型在长序列、多位置一致性上的真实瓶颈,更贴近海报、文档等生产级需求。
  • 四维分离评分体系(text fidelity, text clarity, spatial quality, scene quality)允许独立诊断模型缺陷,而非常规单一 OCR 精度或整体质量分。通过结构化 GT 区域(内容、位置、视觉属性)与 VLM 逐区域判定,该基准能区分模型究竟在字形生成、布局组织还是场景融合上失败。例如 Z-Image-Turbo 相比 Base 清晰度提升 3.81 分但保真度下降 14.76 分,这种细化对比为针对性改进提供了明确方向,且人类评估验证了自动评分的可靠性。

方法

方法概述

输入: 模型接收纯文本提示,提示中明确指定 4–12 个文本区域的精确字符串、内容、位置和视觉属性(如字体、颜色、背景),要求模型在图像中渲染这些密集文本。

关键模块:

  1. 场景分类: 24 个类别,归入 6 大领域(标识标牌、文档印刷、商业、数字界面、结构化数据、创意特效),覆盖真实世界密集文本场景。
  2. 难度分层: 每个场景分为 L1(短文本、少量区域)、L2(中等长度、更多区域)、L3(长文本、最多区域),控制文本数量和布局复杂度。
  3. 双语策略: 英文和中文提示各占一半,每个场景类别均有双语版本,测试模型跨语言渲染能力。
  4. 提示构建与 GT: 每个提示经过人工审核,包含精确 target strings,并生成结构化 ground truth 区域参考(含文本内容、位置坐标、视觉属性),用于后续自动评估。
  5. 评估框架: 使用 Q-Judger 视觉语言模型,将生成图像与结构化 GT 区域对比,在四个维度打分:文本保真度(内容准确性)、文本清晰度(可读性)、空间质量(定位与排版)、场景质量(整体布局合理性)。

输出: 每个模型在四维度上的分数,以及按难度级别、语言、类别聚合的综合得分。

差异点: 与现有基准(如关注短字符串或单一语言)不同,UltraText Bench 通过结构化区域级 GT 和四维 VLM 评估,专门针对多区域、双语、长文本的密集渲染能力,弥补了现有评测在持续性能和工作负载变化上的空白。

实验

实验设计

UltraText Bench 包含 432 个 prompt,覆盖 24 个场景类别 与 3 个难度等级,中英双语各半。每个 prompt 明确给出 4-12 个文本区域 的精确字符串与结构化参考。评估使用 Q-Judger VLM 对生成图像按四个维度打分:文本保真度、文本清晰度、空间质量、场景质量。共测试 24 个模型配置,另由 10 名参与者进行人工校验自动评分。

关键发现

  • 不同模型在维度上呈现差异化优势:Z-Image-Turbo 相比 Z-Image-Base 清晰度提升 +3.81,但保真度下降 -14.76,表明该加速版本牺牲了文本准确性。
  • Qwen-Image-2512 的英语复合分数从 L1 的 86.50 降至 L3 的 42.86,显示密集多区域文本生成在难度增加时性能快速退化。
  • 整体上,模型在单区域短文本上表现尚可,但面对 持续性长字符串、多区域布局 等负载时,文本保真度与清晰度往往无法兼顾。

与基线对比解读

传统文本渲染评估多关注短字符串或全局图像质量,而 UltraText Bench 通过 结构化区域引用 强制模型同时满足内容、位置与排版属性,暴露了复合分数掩盖的单项能力缺陷。例如 Turbo 模型的清晰度提升可能来自更激进的采样步数缩减,但保真度大幅下降提示工程上需在速度与文本准确度之间重新权衡;Qwen-Image-2512 的难度衰减曲线则说明,当前架构的上下文长度或布局规划在 L3 负载下已成为瓶颈。这类分离指标为后续方法改进提供了具体诊断路径,而非笼统的整体评分。

行业影响

落地场景

自动化电商海报与商品详情页、内容平台活动横幅、在线文档排版、UI mockup 填充等需要多区域密集文本的生成任务,均可用 UltraText Bench 进行模型选型与回归测试。

商业价值

基准将文本渲染拆为保真度、清晰度、空间质量、场景质量 四维,量化 trade-off(如 Z-Image-Turbo 清晰度+3.81 而保真度-14.76),帮助团队针对性优化。减少文字错误导致的返工与审核失败,降低单张可用素材的生成成本,加快营销素材迭代,提升转化与用户体验。

跟现有产品/工作流的接口

嵌入 T2I 模型 CI/CD:部署前用 432 条双语 prompt + Q-Judger 自动评分,监测四维指标变化;也可将结构化 GT regions 作为微调或 reward model 的监督信号,强化多区域文本对齐。

具体落地 use case

  • 电商大促图生成:同一图内渲染“限时五折”“全场包邮”“品牌名”等 4-8 个文本区域,用 L2/L3 难度 prompt 筛掉中文渲染差或布局溢出的模型版本。
  • 信息流广告卡片:批量生成课程/金融产品推广卡,校验按钮文案不溢出、不错位,降低平台拒审率。

局限

  • **自动评估的可靠性** 有待加强。论文仅采用 **Q-Judger** 作为自动评估模型,虽然报告了 10 名人类评估者的验证结果,但样本规模偏小,难以充分证明 VLM 评分与人类判断在密集文本、双语、多区域等复杂场景下的一致性与稳定性。相比 **OCR-Bench** 等同类工作采用多评估器集成或更严格的人工校准,单一 VLM 可能引入系统性偏差,尤其在 `text clarity` 和 `spatial quality` 等主观维度上。未来可扩大人类评估规模或引入多模型投票机制以提高评分可信度。
  • **语言覆盖范围** 局限于英语与中文。当前 benchmark 仅涵盖这两大语言,但全球图像生成器需要支持更多语种(如阿拉伯语、日语、韩语、印地语等)的视觉文本渲染。不同文字系统的字形复杂度、排版规则和字符集差异显著,双语设计无法完全代表跨语言泛化能力。此外,中文与英语在字符编码、字体风格上的差异较大,但 benchmark 中场景类别与难度分层的划分是否对两种语言公平仍有待验证,这限制了其作为通用评测工具的普适性。
  • **基准规模与场景多样性** 仍较有限。432 条 prompt 覆盖 24 个场景类别,虽然引入了三维难度分层,但相比大规模 T2I 评测数据集(如 **DrawBench** 的 200 条或 **T2I-CompBench** 的 6000 条)在绝对数量上并不突出;且场景类别偏向真实世界应用(标志、文档、界面等),缺少艺术化、风格化或极端条件下的文本渲染测试。此外,评测依赖严格的结构化参考区域,这可能低估模型在自由形式 prompt 下的生成质量,同时未评估图像的多样性或创意性,导致 benchmark 的生态效度受限。
论文Deyuan Liu2026-10-07原文

相关内容