LLaDA-UI: 将块级扩散引入视觉-语言 GUI 智能体
扩散大语言模型(dLLMs)通过块并行、任意顺序的生成方式获得很高的解码效率,因而对延迟敏感的应用格外有吸引力。GUI 智能体是这一范式的天然试验场:它必须实时反复感知屏幕状态,并输出结构化、具空间落地的动作。但 dLLMs 能否在保持并行解码优势的同时扩展为能力出色的多模态 GUI 智能体,仍是一个开放问题。 我们提出 LLaDA-UI,一个 16.7B 参数、基于 MoE 的块级扩散视觉-语言 GUI 智能体,采用两阶段训练流程: 1. 通用多模态预训练:把原生分辨率视觉编码器 与 LLaDA2.0-mini-base 扩散语言主干对齐; 2. GUI 智能体监督微调:覆盖移动端、桌面、网页与 grounding 等多类数据。 在多个广泛采用的 grounding 与导航基准上,跨多个平台,LLaDA-UI 大幅超越 Qwen2.5-VL-7B,并在 6 项 GUI 基准中的 4 项上超过 Qwen3-VL-8B。这些结果确立了 块级扩散 作为多模态 GUI 智能体一种实用生成范式的地位。
论文精读
TL;DR LLaDA-UI 将块级扩散语言模型扩展为 16.7B MoE 视觉语言 GUI agent,在移动/桌面/网页基准上超越同尺寸自回归模型,同时保留并行解码的低延迟优势。
问题
问题背景
GUI 智能体领域当前关注如何高效感知屏幕状态并实时生成结构化的空间动作。扩散大语言模型(dLLMs)凭借块并行、任意序生成特性,在延迟敏感场景中展现出显著优势,但其能否扩展为多模态 GUI 智能体并保持并行解码效率,仍是待验证的问题。
现有方法局限
现有 GUI 智能体多基于自回归视觉语言模型(如 Qwen-VL 系列、GPT-4V),逐 token 串行解码导致每次动作生成的端到端延迟较高;在需要高频环境交互的任务中,累积时延成为瓶颈。此外,已有的扩散语言模型工作主要聚焦纯文本生成,缺少视觉编码器与扩散语言主干的深度对齐,对屏幕元素坐标回归、指令跟随等空间 grounding 任务支持不足。块并行扩散在多模态条件下的推理策略(如 block size、去噪步数、任意序调度)缺乏系统验证,容易造成生成质量与并行效率的失衡。
为什么这个问题难/重要
GUI 智能体必须在实时交互循环中反复感知屏幕并输出可执行动作,对模型延迟和吞吐要求极为苛刻。多模态扩散需要同时建模连续视觉特征与离散文本 token 的联合分布,训练稳定性和收敛难度显著高于纯文本扩散。MoE 架构进一步引入专家路由与负载均衡挑战。业界对低延迟 Agent 系统的需求日益迫切,若 dLLM 能在多模态场景下保持块并行解码优势,有可能替代自回归方案成为 GUI 智能体的高效生成骨干。
行业类比
这一范式类似实时视频流理解或自动驾驶决策,需要对每一帧或每一状态快速给出可执行指令;扩散并行解码的引入,可能重构交互式 AI 系统的时延上限。
核心洞察
- 扩散语言模型首次作为 GUI agent 的主干,验证了 block-parallel 生成在实时交互场景中的可行性。与逐 token 生成的 AR 模型(如 Qwen2.5-VL-7B、Qwen3-VL-8B)不同,dLLM 的任意顺序生成允许一个时间步并行解码多个 token,将动作生成延迟从 O(n) 降低到 O(n/k),k 为 block 大小。LLaDA-UI 在六个 GUI 基准上实现了与 AR 模型相当或更好的精度,证明了扩散范式在 GUI 代理中不仅能匹配精度,还能从生成机制上直接缓解延迟瓶颈,为延迟敏感的多模态应用提供了新的工程选项。
- 两阶段训练中采用原生分辨率视觉编码器与扩散语言骨干对齐,是实现高精度 GUI grounding 的关键。许多通用 VLM 采用固定分辨率或图像分块策略,GUI agent 若沿用该设置,屏幕上的小按钮、图标和文字易丢失细节;LLaDA-UI 采用原生分辨率视觉编码器,保留完整空间信息并与扩散语言骨干对齐,使视觉细节直接参与动作生成。在 ScreenSpot-Pro 等细粒度基准上,该设计帮助模型达到 65.2 分,显著超过 7B 基线。这一策略启示工程实践:处理 GUI 场景时应优先设计高分辨率视觉通路,而非简单复用通用 VLM 的图像处理流程。
- MoE 架构与扩散解码的组合,在模型容量与推理能耗之间提供了新的权衡点。LLaDA-UI 总参数量 16.7B,但通过稀疏激活的 MoE 路由,每次推理仅使用部分专家,配合 block-parallel 解码,理论上可降低单步动作生成的 FLOPs 与 wall-clock 时间。论文的 paired API latency 实验进一步量化了扩散解码相较于 AR 基线在相同硬件上的延迟差异。与常见的量化、蒸馏或投机解码等 AR 加速手段不同,该工作从生成范式层面改变了延迟-精度曲线,为移动端部署或高并发 GUI 服务提供了更原生高效的实现路径。
方法
输入与整体流程
LLaDA-UI 接收屏幕截图(原生分辨率,不进行降采样)和可选的自然语言任务指令,输出结构化 GUI 动作(如点击坐标、输入文本、滑动路径)。整体流程为:视觉编码器提取图像特征 → 与文本指令嵌入融合 → 扩散语言骨干进行块并行、任意顺序解码 → 得到动作序列。
关键模块
- 视觉编码器:采用 native-resolution vision encoder,直接处理原始分辨率屏幕图像,保留 UI 元素的精细空间信息,对 grounding 任务至关重要。
- 扩散语言骨干:基于 LLaDA2.0-mini-base,16.7B 参数的 MoE 架构,使用 block-wise diffusion 生成。在推理时,模型将 token 序列划分为块,每个块并行去噪,而非逐 token 自回归,从而大幅降低延迟。
- 多模态对齐:第一阶段预训练将视觉特征与扩散语言空间对齐,第二阶段在移动、桌面、网页、grounding 等多样 GUI 数据上做监督微调(SFT),使模型学会生成空间接地的动作。
训练策略
- 阶段一(预训练):用通用多模态数据训练,优化噪声预测目标(扩散损失),让模型学习图文联合表示。
- 阶段二(GUI SFT):在 GUI 导航与 grounding 数据集上微调,损失函数为标准的扩散去噪损失,采用高质量轨迹和坐标标注。
输出与推理
模型输出结构化文本,包含动作类型和坐标参数,可直接由执行环境解析。由于块并行解码,多步 GUI 交互的端到端延迟显著低于自回归模型。
与同类方法的差异点:相较于 Qwen2.5-VL-7B 等自回归视觉语言模型,LLaDA-UI 用扩散生成替代逐 token 预测,在保持或超越其 GUI 任务性能的同时,推理效率更高,更适合实时交互场景。
实验
实验设计
- LLaDA-UI 采用两阶段训练:多模态预训练(原生分辨率视觉编码器 + LLaDA2.0-mini-base 扩散语言主干)和 GUI-Agent 监督微调(移动、桌面、网页、grounding 数据)。
- 评估覆盖跨平台 GUI 基准:ScreenSpot-V2 / ScreenSpot-Pro(grounding)、AndroidWorld / MobileWorld(移动)、OSWorld(桌面)、WebVoyager(网页)。
- 基线包括 Qwen2.5-VL-7B、Qwen3-VL-8B、Qwen3.5-9B 等自回归视觉语言模型。
关键发现
- LLaDA-UI 在 ScreenSpot-V2 上达到 94.0,ScreenSpot-Pro 达到 65.2,AndroidWorld 57.8,OSWorld 41.8,WebVoyager 56.9。
- 相比 Qwen2.5-VL-7B,LLaDA-UI 在所有报告基准上显著领先;相比 Qwen3-VL-8B,在六个基准中的四个上胜出,显示扩散范式在多模态 GUI 任务上的竞争力。
- 定性分析显示,扩散解码过程能逐步 refine 结构化动作,对长程任务中的屏幕观测有较好适应性。
与基线的深度解读
- 传统自回归 VLM 在 GUI 交互中需逐 token 串行生成,延迟高且难以并行响应高频屏幕状态;LLaDA-UI 的 block-wise diffusion 可并行解码多个 block,在保证动作质量的同时降低推理延迟。
- 从指标看,LLaDA-UI 在 grounding 密集的 ScreenSpot 系列上表现突出,而在复杂导航任务(如 MobileWorld 25.6)上仍有较大提升空间,说明多步决策、长程依赖仍是扩散模型需要攻克的难点。
- 工程启示:对于需要实时感知和响应的 GUI Agent,扩散模型提供了与自回归模型互补的延迟-质量权衡选项;后续优化可聚焦于 动作空间设计 与 长程一致性。
行业影响
落地场景
LLaDA-UI 可直接用于 实时 GUI 自动化:移动端 App 测试、桌面办公自动化、Web 流程机器人。典型 use case:在电商运营中,自动处理多平台订单,从聊天工具抓取客户地址,填入 ERP 并生成物流单;或在企业服务中,自动操作 CRM/财务软件完成数据录入与对账。
商业价值
延迟敏感型业务 受益明显:块并行解码大幅降低单步动作生成时延,提升 agent 在长流程任务中的响应速度,改善用户体验与任务完成率。MoE 架构在 16.7B 总参数下激活参数更少,推理成本低于同量级稠密模型。在 GUI 导航 benchmark 上超越 Qwen2.5-VL-7B 等模型,企业可用更小算力预算获得更高准确率,实现降本增效。
与现有产品/workflow 的集成
LLaDA-UI 可封装为 视觉语言模型服务,通过 OpenAI-compatible API 接入现有 agent 框架(LangChain、AutoGen、CrewAI)。输入截屏图像和任务指令,输出结构化动作(点击坐标、输入文本),与 Playwright、Appium 等自动化工具无缝配合。现有基于 Qwen-VL 或 GPT-4V 的 agent 方案可替换模型后端,保留 prompt 与动作解析逻辑,快速迁移。
工程上需注意:扩散模型去噪迭代虽支持块并行,但首次 token 延迟可能高于 AR 模型;短响应场景需权衡是否启用缓存去噪步骤或投机解码。
局限
- - **计算与部署成本**:虽然采用 MoE 架构降低了激活参数,但 LLaDA-UI 总参数量高达 16.7B,训练所需的计算资源与数据收集成本显著高于同量级稠密 AR VLM。block-wise diffusion 的并行解码优势高度依赖定制推理框架与超参(block 大小、去噪步数、视觉编码器协同),论文虽提及配对 API 延迟但未披露具体数值,实际端到端延迟、显存占用与吞吐表现仍存在不确定性。
- - **数据与任务覆盖**:训练数据覆盖 mobile、desktop、web 和 grounding 四类,但未公布各平台数据规模、质量过滤策略及跨平台迁移细节,数据偏差可能削弱对未覆盖环境或非标准界面的泛化能力。评估集中在六项 GUI benchmarks,多为单轮 grounding 或中等长度导航任务,对长期多步交互、罕见 UI 元素、动态界面变化等复杂场景覆盖不足,难以验证扩散式生成在实际持续控制任务中的稳定性。
- - **对比基线与长时程局限**:对比基线仅包括 Qwen2.5-VL-7B、Qwen3-VL-8B 和 Qwen3.5-9B 等较小规模 AR VLM,缺少与更大容量模型或同参数量级 AR VLM 的严格匹配比较,难以完全排除模型容量提升带来的效果。论文在“Structured Actions and Long-Horizon Failures”一节提到长时程任务中的结构化输出失败问题,但未给出系统性量化分析或消融缓解方案,这可能是 block-wise diffusion 在多步 GUI 交互中的固有弱点。