论文

HiLo-Token: 用于高效图像编辑的输入自适应高低频令牌压缩

HiLo-Token: 用于高效图像编辑的输入自适应高低频令牌压缩

创意图像编辑工具(如 Photoshop 的 Remove 或 Generative Fill 按钮)在日常客户使用中占据核心地位,并在 Photoshop 和 Lightroom 的流量中占主要份额。然而,当前生成式 AI 模型面临显著的延迟挑战,特别是当从基于卷积的 U-Net 过渡到 Diffusion Transformers (DiTs) 时更为突出。 为应对这一挑战,我们提出 HiLo-Token,一种输入自适应令牌压缩框架。该框架在高频、丰富上下文区域分配更多令牌预算,而在低频区域分配较少令牌。具体地: - 在用户指定的编辑区域内,保留膨胀掩码内的所有令牌以保持强局部性和上下文相关性; - 在编辑区域外,引入基于空间频率的高频令牌选择策略,以捕捉重要局部细节,同时使用来自 16 倍下采样图像的令牌表示低频成分,保留模糊但全局的结构。 在包含数百个代表性图像编辑样本(涵盖多种掩码比例)的生产级评估数据上,实验验证了方法的有效性。对于小、中、大掩码比例类别(平均比例分别为 6.38%、15.92%、35.36%),在 A100-80GB 上分别实现了 3.13 倍、2.59 倍和 1.67 倍的 DiT 加速,且生成质量无任何下降。

论文精读

TL;DR HiLo-Token 根据图像空间频率自适应压缩 Diffusion Transformer 的 token,对编辑区域保留全部 token、其他区域用高频选择+低通下采样,在图像编辑中实现最高 3.13 倍 DiT 加速且质量无损。

问题

问题背景

当前图像编辑领域的生成式 AI 模型(如 Adobe Firefly 系列、Google Gemini 等)已经能够完成高质量的局部修复、补全和扩图。然而,模型延迟是落地到交互式工具(如 Photoshop 的移除 / 生成式填充)的核心障碍,尤其是在主流架构从 U-Net 转向 Diffusion Transformer (DiT) 之后,自注意力机制对 token 数量的依赖进一步放大了计算开销。

现有方法局限

常规加速手段——知识蒸馏步数剪枝量化低秩分解——在 DiT 场景下面临明显的质量 – 速度取舍:蒸馏到 8 步后 DiT 模块仍占全链路延迟的 73%,继续压缩步数会显著损害生成细节。另一方面,统一 token 压缩(如对所有 token 做均匀下采样或聚类)完全不考虑编辑任务特有的 mask 区域异质性:用户掩码内外的像素重要程度截然不同,简单一视同仁会导致编辑区域边缘模糊、纹理丢失,或非编辑区域结构崩塌。

为什么这个问题难 / 重要

挑战在于需要输入自适应地分配 token 预算:既要充分保留 mask 附近的高频细节以确保编辑质量,又要大幅降低背景区域的计算量以实现加速。同时,不同生产场景的 mask 比例差异极大(论文覆盖 6.38% 到 35.36%),要求方法在 小、中、大 mask 下都保持鲁棒,不能因为背景占比高就破坏全局结构,也不能因为 mask 占比大就失去加速效果。业界高度关注此问题,因为交互式创意工具的用户对延迟感知极其敏感,每一毫秒的优化都直接关系到产品体验和流量转化。

行业类比

类似视频会议的 ROI 编码:把人脸区域分配高码率保证清晰度,背景用低码率节省带宽——图像编辑中也需要对“编辑关注区”和“非编辑区”实施差异化的计算资源分配,以达到速度与质量的最优平衡。

核心洞察

  • HiLo-Token 引入任务感知的 token 压缩,将图像编辑中用户 mask 区域的 token 全保留并膨胀,而非全局等比例减少。这直接对齐编辑需求——mask 区域细节决定生成质量,外部可大幅压缩。传统方法(如 ToMe、DCT 压缩)无此区分,导致关键区域质量退化或压缩率不足。该设计揭示了生成模型加速应从任务语义出发,为交互式编辑工具的瓶颈优化提供了可落地的工程范式。
  • 高低频解耦的 token 表示是该工作的另一独特视角:在 mask 外部,高频 token 通过空间频率显式选取,独立保留局部细节;低频 token 则用 16× 下采样特征替代,维持模糊全局结构。这与以往用注意力分数或随机丢弃的做法不同,它利用信号处理先验分离信息层级,实现更高保真度的稀疏化。工程上,这为视觉 token 压缩提供了一种结构感知的预算分配策略,可推广至其他密集预测任务。

方法

输入与预处理

HiLo-Token待编辑图像用户掩码为输入。首先对掩码进行膨胀(dilation),得到一个扩展编辑区,确保边界上下文信息不被丢失。编辑区外定义为背景区域,后续在此区域进行压缩。输入图像还会通过 16× 下采样生成低分辨率版本,用于提取低频全局 token。

关键模块:高频 token 选择与低频 token 提取

框架的核心是将背景区域 token 分为两类:高频 token低频 token

  1. 高频 token 选择: 对背景区域图像块计算空间频率(如利用梯度幅值或局部方差),选择响应最强的 top-k 个块对应的 token,这些 token 保留关键边缘、纹理等局部细节信息。此策略是输入自适应的,根据每个样本的内容动态决定保留哪些 token,而非固定位置下采样。
  2. 低频 token 提取: 直接将 16× 下采样后的图像输入视觉编码器(如 VAE),得到一组 token,它们表达模糊但完整的全局结构,补充高频 token 所缺失的大范围上下文。

编辑区内的所有 token 全部保留,以保证该区域生成质量不受影响。最终,膨胀掩码内的全部 token背景高频 token全局低频 token 拼接在一起,构成压缩后的 token 序列,输入 Diffusion Transformer (DiT) 进行去噪生成。

训练与适配

HiLo-Token 采用后训练方式,即在已蒸馏的 DiT 模型上,用压缩 token 序列进行微调,使模型适应非均匀 token 分布。训练时保持原扩散损失,无需额外约束。由于 token 数量显著减少(尤其在高 mask 比场景),推理延迟大幅降低。

与同类方法的差异

与传统基于固定步长下采样或 uniform token 剪枝的方法不同,HiLo-Token 依据空间频率和编辑区域重要性进行动态、非均匀的 token 分配,同时显式分离高/低频表示,在效率与生成质量间取得更优平衡。

实验

实验设计

  • 内部生产级图像编辑数据 上评估,按用户遮罩面积比例划分为 small (平均 6.38%)、medium (15.92%)、large (35.36%) 三类。
  • 基线为蒸馏后的 DiT (50步→8步),不进行任何 token 压缩;重点考察 DiT 模块延迟生成质量
  • 使用 HiLo-Token 对 DiT 输入 token 进行自适应压缩,并在 A100-80GB GPU 上测量加速比。

关键发现

  • small mask 场景下,HiLo-Token 实现 3.13× 加速;medium 场景加速 2.59×large 场景加速 1.67×,所有场景均无质量退化
  • 加速增益随遮罩增大而递减:小遮罩允许大量背景 token 被压缩为低频全局表示;大遮罩下仍需保留较多 token 以维护编辑区域上下文,但 1.67× 加速依然显著。

对比解读与工程启示

  • 相比直接使用 8-step DiT,HiLo-Token 利用 空间频率高低频分离,在编辑区域外选取高频边缘 token 并辅以 16× 降采样低频 token,在保留局部细节与全局结构的同时大幅降低计算量。
  • 该方法区别于均匀降采样或随机 token 丢弃,由输入内容自适应决定 token 预算分配,更贴合自然图像先验,避免了常见压缩方法中结构丢失或模糊。
  • 从工程角度看,HiLo-Token 支持 后训练微调,无需重训基座模型,易于集成至现有 DiT 编辑管线,为低延迟实时编辑工具提供了可行技术路径。

行业影响

落地场景

HiLo-Token 直接瞄准实时 / 近实时的生成式图像编辑产品,如 Photoshop 的移除 / 生成式填充Lightroom 的修复画笔,以及 Canva、Figma 等设计工具中基于 DiT 的局部重绘、背景替换等功能。它同样适用于需要边缘侧推理的移动端图像编辑 App,在算力、带宽受限时压缩 token 以降低延迟。对于云端批量图像处理服务(如电商商品图自动化修饰、UGC 内容审核后修复),模型推理成本是核心瓶颈,该框架可显著提升吞吐量。

商业价值

  • 降本:DiT 推理延迟占据总延迟的 73%,HiLo-Token 平均可取得 1.67×–3.13× 加速(A100),直接降低每请求的 GPU 占用时间与云服务成本,同时允许同一硬件支撑更高并发。
  • 增收:更快的生成响应能减少用户等待焦虑,提升编辑功能的使用转化率与留存率,尤其在付费订阅制 SaaS 中,体验提升直接影响续费率。
  • 体验提升:在移动端或交互式应用中,从秒级延迟到亚秒级的改进,使专业级 AI 编辑功能能够实时跟随用户手势,增强产品的竞争力。

与现有工作流接口

HiLo-Token 是一种训练后微调方法,可直接插入已有的 DiT 编辑模型管道,无需修改模型结构。集成步骤极简:

  1. 在蒸馏后的 DiT(如 8 步 denoising)基础上,将输入图像与用户掩码传入 HiLo-Token 模块;
  2. 输出压缩后的 token 序列送入原 DiT 进行后续处理;
  3. 仅需少量步数的微调来适配 token 分布变化,即可恢复质量。

该框架对模型架构无强依赖,可泛化至任意基于 transformer 的图像生成模型,天然匹配当前主流的生产环境(如 PyTorch + Diffusers 栈),无需重构推理服务。

具体落地用例

  • 电商商品图流水线:平台需每日处理数十万张商品图片,涉及背景移除、瑕疵修复、水印消除等工序。HiLo-Token 加速 DiT 后,可在相同 GPU 集群上将吞吐量提升 2–3 倍,或减少 60% 的 GPU 实例,直接降低运营成本,同时保持图像质量以满足展示标准。
  • 社交媒体创作工具:移动端应用(如 Clipdrop、Lensa)的智能填充与移除功能常受限于设备算力。将 HiLo-Token 应用于轻量级 DiT 骨干(如 DiT-S),可让模型在手机端实时运行(< 500ms),支撑用户快速迭代创意,提高日活和产品粘性。

局限

  • - **任务局限性**:HiLo-Token 的设计强依赖于用户提供的编辑掩模(mask),这限制了其在无掩模场景(如无条件图像生成或通用图像编辑任务)中的适用性。对于大规模图像编辑,方法需要预先知道哪些区域需要保留细节,否则高频 token 选择策略可能缺乏语义指导,影响生成一致性。在实际产品中,编辑区域往往由用户操作指定,但若扩展到自动修复或补全任务,仍需要额外的显著性检测或预分割步骤,增加了工程复杂度。
  • - **泛化性未充分验证**:实验仅在 Adobe 内部的 DiT 模型和私有评估数据上进行,缺乏与公开基准(如部分知名编辑数据集)的对比,这限制了方法的可复现性和横向比较。另外,方法仅针对 DiT 架构进行了验证,对于其他扩散骨干(如基于 U-Net 的模型)或更大规模的 DiT(例如 FLUX 等)尚未测试,其在高分辨率、长序列条件下的泛化能力存疑。部分参数(如膨胀掩模半径、下采样因子)可能需要针对不同模型规模调优,实际部署时增加调参成本。
  • - **加速比与质量权衡的潜在脆弱性**:尽管论文声称无明显质量下降,但在高掩模比例(35.36%)场景下 DiT 加速仅为 1.67×,实际端到端加速效果可能更低(因为 DiT 仅占总延迟 73%)。低频组件使用 16× 下采样虽保留全局结构,但可能丢失中频纹理细节,在一些需要进行精细纹理匹配的编辑任务中可能出现不自然过渡。此外,高频 token 选择策略基于空间频率,可能对噪声或压缩伪影敏感,需要额外的预处理或自适应阈值调节。
论文Haoran You2026-06-11原文

相关内容