IndusAgent: 利用代理工具增强开放词汇工业异常检测
多模态大语言模型 (MLLMs) 在连接视觉感知与文本推理方面展现出显著能力,可在多种工业场景下实现零样本理解。然而,它们在开放词汇工业异常检测 (IAD) 中的性能常受限于领域不匹配的推理和幻觉性的结构推断。为应对这些挑战,我们提出 IndusAgent,一个工具增强的代理框架,用于开放词汇 IAD。 具体而言,我们首先构建 Indus-CoT,一个结构化数据集,集成全局视觉观察、高分辨率局部块以及专家正常先验知识,为模型在严格的工业检测轨迹上微调提供监督。在此基础上,IndusAgent 动态编排一组外部工具,包括动态区域裁剪、高频特征增强和先验检索,从而使代理能够主动解决视觉歧义并解耦细微异常。 此外,我们引入一个门控强化学习目标,联合优化异常分类、定位精度、异常类型推理以及工具使用效率,确保仅在有益时调用工具。在五个工业异常基准(包括 MVTec-AD、VisA、MPDD、DTD 和 SDD)上的广泛评估表明,IndusAgent 在所有现有方法中实现了最先进的零样本性能,验证了其鲁棒性和泛化能力。
论文精读
TL;DR IndusAgent 将多模态大模型构建为能主动调用视觉工具(如动态裁剪、高频增强)的智能体,并通过门控强化学习提升开放词汇工业异常检测的零样本精度与可解释性。
问题
工业异常检测正从闭集设定走向开放词汇识别,要求模型在不依赖预定义类别的情况下,对未知缺陷进行像素级定位与语义推理。这一趋势推动了对强泛化视觉理解能力的探索。
现有方法的局限在于:MLLM 直接应用于工业缺陷检测时,其推理往往与工业质检的严谨流程脱节。具体表现为:(1) 模型容易产生幻觉式结构推断,将正常纹理变化误判为缺陷,或对真实异常的形状、几何关系做出错误描述;(2) 缺乏对局部高分辨率细节的有效利用,全局粗粒度的视觉特征难以捕捉微小划痕、色差等类工业异常;(3) 推理过程缺乏对标准参照品的先验知识,导致模型无法可靠地区分“工艺公差内的正常变异”与“真正需报警的异常”。这些局限使得直接使用现成 MLLM 在高精度 IAD 任务上性能不足。
该问题之所以困难且重要:工业异常检测对精度与可解释性要求极高,容错率低,且真实产线中缺陷样本稀少,零样本能力是关键。挑战在于,模型必须同时解决细粒度视觉定位、跨域知识适配与逻辑推理一致性的问题,而这三者在当前 MLLM 的训练范式中往往互相牵制。业界对利用大模型实现柔性质检的需求日益增长,推动了 agentic 框架在此方向的探索。
类似自动驾驶领域,单纯依靠端到端感知网络难以处理所有角落案例,业界转向感知-规划-控制的分层架构,通过分治与工具协作提升安全性。IndusAgent 的思路恰似为工业视觉质检构建一个可调度工具的推理驾驶舱。
核心洞察
- **工具增强的智能体范式克服了通用 MLLM 在开放词汇工业异常检测中的领域推理偏差**。现有 MLLM 直接应用于工业场景时,常因缺少领域特定的感知逻辑而产生与任务对齐不佳的推理或幻觉结构。IndusAgent 通过动态编排一组外部工具(区域裁剪、高频增强、先验检索),让智能体在推理过程中主动调用这些工具来澄清视觉歧义,从而更符合工业检测的逐步确认流程。这一设计将静态的模型推理转化为可交互的检测轨迹,在 MVTec-AD 等基准上大幅超越同类零样本方法。
- **门控强化学习实现了工具调用的成本敏感优化,避免盲目使用工具导致效率下降**。多数工具增强方法让模型无差别地调用工具,可能引入多余计算开销。IndusAgent 在准确性门控的奖励设计中,仅当工具对分类、定位或推理有实际增益时才给予正向激励,联合优化检测质量与工具使用效率。这使得智能体学会“按需求助”,在保持高精度的同时减少冗余交互,为工业应用中模型推理与工具使用的实用平衡提供了新思路。
方法
方法概览
IndusAgent 将开放词汇工业异常检测定义为多模态代理推理问题。输入工业图像和自由文本查询(如“是否存在刮痕”),输出包括异常存在性判断、精确定位框、异常类型语义描述。核心思想是让多模态大语言模型(MLLM)充当主动决策者,动态调用外部视觉工具来消除感知歧义。
关键模块
1. 结构化思维链数据集 (Indus-CoT) 与监督微调
为使 MLLM 掌握工业检测的规范化推理,首先构建 Indus-CoT 数据集。每条样本整合三种信息:全局低分辨率场景观察、动态裁剪的高分辨率局部区域、专家标注的正常样本先验。模型在监督微调阶段学习“整体扫描→局部聚焦→对比正常范本→判定异常”的严格推理链路,从而抑制幻觉和不合理的结构推断。
2. 动态工具库
推理时,代理可调用四种外部工具:
T_crop:根据注意力热点自动裁剪高分辨率子图,放大可疑区域;T_enhance:通过高频特征增强(如边缘强化)突显微小纹理缺陷;T_prior:检索视觉相似的正常样本,提供对比基准;T_measure:几何验证,量化形变或尺寸偏差。 工具以函数调用形式挂载,模型自主决策何时使用。
3. 门控强化学习
为在精度与效率间取得平衡,设计门控 RL 目标。奖励函数综合考虑分类准确度、定位 IoU、异常类型语义匹配度,并对冗余工具调用施加成本惩罚。通过策略梯度更新,模型学会仅在不确定性高时才触发工具,避免无效计算。
与同类方法差异
不同于传统静态视觉编码器的一次性检测,IndusAgent 将 MLLM 作为主动探索引擎,工具调用受门控 RL 约束,在零样本开放词汇条件下实现了推理鲁棒性与资源消耗的统一。
实验
实验设计
在五个工业异常检测基准上评估零样本性能,涵盖物体、纹理、部件与场景:MVTec-AD、VisA、MPDD、DTD 和 SDD。所有方法均不依赖目标缺陷的标注样本,仅通过开放词汇描述进行推理。对比基线包括多模态大模型直接问答、工具增强框架以及现有 IAD 智能体。核心指标为图像级分类 AUROC、像素级定位 IoU 和异常类型推理准确率。
关键发现
IndusAgent 在所有基准上取得最优零样本结果,尤其在细粒度异常定位和语义类型推断上大幅领先。动态工具调度(T_crop 区域裁剪、T_enhance 高频增强、T_prior 先验检索)有效缓解了 MLLM 的领域偏差和结构幻觉;门控强化学习目标在维持检测性能的同时显著降低工具调用开销。消融实验证实,工具选择性激活对处理视觉歧义与细微缺陷至关重要。
基线对比解读
与直接微调的多模态模型相比,IndusAgent 通过工具感知的强化学习实现了“按需调用”,避免了固定流程的冗余计算;相较于现有 IAD 智能体,结构化推理链 Indus-CoT 提供了更精细的监督信号,使模型学会何时借助外部工具而非盲目猜测。这种“感知-规划-验证”的闭环设计,使得跨域泛化更稳定,在复杂场景下的误判率明显低于强基线,验证了工具增强智能体在开放词汇工业检测中的工程化潜力。
行业影响
落地场景
IndusAgent 可直接嵌入工业视觉检测产品线,覆盖半导体晶圆缺陷复查、汽车零部件表面瑕疵分拣、食品包装异物筛查、3C电子装配外观检验等高频场景。电商平台的商品合规巡检(如服饰线头、印刷偏移)也能通过开放词汇能力快速适配新品 SKU,无需为每种缺陷重新标注样本。内容平台对用户上传的实体物品图像(二手交易品相鉴定)可借助该框架提升自动化审核精度。
商业价值
在降本维度,IndusAgent 的 零样本泛化 特性可大幅减少产线换型时的数据采集与标注成本(通常占据视觉项目总成本的 40%–60%),同时降低对稀缺领域专家的依赖。在增收维度,更高的检测准确率直接减少漏检导致的批量退货与客诉罚款,而 动态工具调用 仅在必要时才启用高算力操作(如高分辨率裁剪、频域增强),避免传统方案全程高开销,实现边缘端与云端成本的精确控制。体验提升方面,开放词汇的推理结果可自然语言化,辅助操作员快速定位根因,缩短宕机排查时间。
与现有产品 / 工作流的接口
IndusAgent 可作为 MLLM 推理微服务 接入现有 MLOps 流水线。训练阶段提供 Indus-CoT 数据集 与 门控强化学习目标,可直接基于开源多模态模型(如 LLaVA 系列)微调;推理阶段对外暴露 HTTP/gRPC 端点,上游检测框架(如定制化的 YOLO/Mask R-CNN 预处理管线)将候选区域递交给 Agent,Agent 根据置信度自主决定是否调用 T_crop、T_enhance、T_prior 等工具,最终输出分类、定位框、缺陷类型解释,通过消息队列回写至产线 MES 系统或缺陷管理面板。现有规则引擎或传统视觉模块可作为先验知识库(T_prior 来源)与 Agent 协同,无需推倒重建。
具体落地用例
- 跨境电商平台商品合规检验:商家上架新款服饰时,平台需抽检是否存在污渍、破洞、印花歪斜等外观缺陷。IndusAgent 通过开放词汇描述(如“检查袖口是否有脱线”)直接对新品类执行零样本检测,避免每个季度为数千新款式重新训练分类器。当图像模糊或纹理复杂时,Agent 动态调用
T_enhance增强牛仔布纹理对比度,再结合T_prior中存储的正常品样貌特征,准确区分面料固有褶皱与真实破损,将误报率控制在商业可接受水平。 - 自动驾驶感知硬件质检:车载摄像头模组出厂前需检验镜头划痕、组装歪斜、CMOS 坏点等异常。IndusAgent 被集成进摄像头模组自动光学检测(AOI)设备,接收高分辨率图像后,首先用
T_crop关注镜片中央、边缘密封圈等关键区域,通过T_measure校验安装角度偏差,并以自然语言产出“镜头右上象限存在三处>50μm 划痕”的结构化报告,对接 MES 系统直接卡控不良品,实现全自动闭环。
局限
- **推理延迟较高,难以满足实时产线需求**:IndusAgent 依赖 MLLM 进行多步推理,并动态调用工具(动态裁剪、高頻增强、先验检索等),单次检测可能涉及数轮模型交互。论文未报告端到端延迟,但在高吞吐量工业检测线上,这种 agentic 流程的耗时可能远超传统视觉模型,限制了在苛刻实时场景下的部署。
- **构建 Indus-CoT 数据集需要大量专家先验**:模型微调依赖 Indus-CoT,其中包含了全局观察、高分辨率局部块、专家正常先验与推理轨迹。这类标注成本高,且对“正常”的定义强依赖领域专家。当迁移到全新工业场景时,缺乏类似结构化先验会导致性能衰减,泛化门槛较高。
- **工具库的预设性限制了对未知异常的响应**:预设的工具集(裁剪、增强、先验检索、几何验证)覆盖了常见的歧义消除模式,但工业异常形态多样,可能出现工具库未覆盖的未知结构或背景干扰。此时 agent 可能无法触发有效工具,从而影响检测鲁棒性。论文未讨论工具动态扩展机制。