论文

Known By Their Actions: 通过UI轨迹识别LLM浏览器代理

Known By Their Actions: 通过UI轨迹识别LLM浏览器代理

随着基于LLM的代理愈发频繁地替代用户浏览网页,一个自然的问题浮现:网站能否被动识别出驱动代理的底层模型?若能,将构成重大安全风险,使针对已知模型漏洞的定向攻击成为可能。 本研究跨越14个前沿LLM及四个涵盖信息检索与购物任务的网页环境,利用被动JavaScript追踪器捕获代理的动作与交互时序,发现这些数据足以识别底层模型,F1分数高达96%。我们通过展示基于代理动作训练的分类器可跨模型规模与系列泛化,正式确立了这一攻击面。 实验进一步表明:1. 强分类器可从少量交互轨迹训练而成;2. 代理身份可在单个回合早期被推断;3. 注入随机化动作间隔虽会显著降低分类器性能,但无法提供稳健防护——对延迟轨迹重新训练后,分类器性能基本恢复。 我们已发布实验工具与标注轨迹语料库(https://github.com/KabakaWilliam/knownactions)。

论文精读

TL;DR 网站能通过 JavaScript 被动采集 LLM 代理的 UI 操作与时间特征,以最高 96% F1 识别底层模型,揭示一种可被用于定向攻击的新型侧信道威胁。

问题

问题背景

LLM-based browser agent 正迅速成为自主 Web 交互的主流范式,其安全边界高度依赖底层模型的身份保密性。一旦模型指纹泄露,攻击者便能针对特定模型漏洞发起精准攻击,这使得 被动模型识别 成为亟需正视的新型攻击面。

现有方法局限

传统模型指纹方案多依赖直接查询模型 API 或分析生成文本的统计特征,无法适用于 代理交互场景:网站仅能观察到 DOM 事件与网络请求。此外,已有工作忽略以下关键限制:

  • 仅靠单轮文本响应不足以区分行为相似的模型,而代理的多步 操作轨迹 包含丰富的行为差异;
  • 时序特征(动作间隔、决策延迟)长期被低估,但却是区分模型架构与规模的核心信号;
  • 现有防御(如添加随机延迟)缺乏系统性评估,且在自适应攻击下是否鲁棒仍未知。

为什么这个问题难且重要

技术挑战 来自三方面:

  1. 特征构建:须从低层级 UI 事件中提取出跨网站、跨任务泛化的行为表征,同时避免过拟合特定 DOM 结构;
  2. 开集识别:现实场景中,模型可能在训练集中未出现,分类器需同时具备高闭集准确率与可靠的开集拒绝能力;
  3. 适应性防御:随机延迟虽可降低分类性能,但攻击者只需用延迟轨迹重新训练即可大幅恢复精度,表明仅靠添加噪声不足以消除指纹,需设计更根本的混淆策略。

业界关注度 高:LLM agent 正被集成到浏览器自动化工具(如 Playwright、Selenium)、RPA 及个人助手,其模型指纹一旦被利用,可导致定向提示注入、成本膨胀攻击及模型特定访问控制绕过等严重后果。

行业类比

该风险类似于搜索引擎通过用户点击行为序列识别爬虫类型,区别在于 LLM agent 的操作轨迹不仅暴露自动化本身,更直接泄露背后的模型身份与能力边界。

核心洞察

  • **被动行为侧信道可高精度识别底层 LLM 模型**。 不同于主动探测或请求头泄露,本研究仅通过一个轻量级 JavaScript 追踪器收集代理的点击、滚动、输入等 UI 交互与操作间时间间隔,即可在 14 个前沿 LLM 上实现最高 96% F1 的分类准确率。 这一攻击向量的独特性在于其**完全被动且隐蔽**——网站无需任何权限提升或模型配合,仅凭用户不可见的前端埋点就能大规模、低成本地获取模型指纹。 对实际工程的启示是:任何允许第三方脚本运行的 Web 代理环境都可能暴露模型身份,攻击者可据此实施模型特定的提示注入或资源消耗攻击。
  • **行为指纹展现出跨任务与跨网站的强泛化能力**。 实验表明,在一种网站或任务类型上训练的分类器能有效迁移到未见过的购物或信息检索场景,甚至在不同模型尺寸、家族之间同样成立。 这说明 LLM 在浏览器交互中表现出的行为差异并非任务偶发,而是**模型训练过程、偏好对齐或推理策略带来的固有特征**,类似于生物特征中的步态识别。 与仅依赖请求头或 API 响应的传统方法相比,这种基于 UI 轨迹的泛化性使攻击者的先验知识需求大幅降低,防御方则难以通过简单更换环境或任务来规避指纹。 对安全设计而言,这意味着模型提供商可能需要从行为多样性与归一化角度考虑降低指纹可识别性,例如在微调时注入行为噪声或标准化决策时机。

方法

输入:被动 JavaScript 追踪器捕获交互轨迹

网站嵌入轻量级 被动 JavaScript 追踪器 ,记录 LLM 代理与页面交互时的行为事件时间戳。事件类型包括点击、输入、滚动等基本 UI 操作,每条事件携带精确的 timing 信息。追踪器仅需浏览器 JavaScript 执行环境,无需额外权限,完全被动运行,不修改页面内容。

特征工程与分类建模

从轨迹中提取两类特征:

  • 行为特征集 :将事件序列编码为固定长度的统计描述,如事件类型频率、动作序列 n-gram、交互顺序模式。
  • 时间动态 :计算动作间延迟分布、步骤耗时、思考时间等时序统计量,捕捉不同模型在响应节奏上的差异。

任务形式化为闭集分类(已知模型集合内识别)与开集分类(区分已知模型与未知模型),使用四种分类器:

  • 随机森林XGBoost:树模型善于捕捉非线性组合特征,对噪声鲁棒。
  • 逻辑回归:线性基线。
  • LSTM:建模序列上下文依赖。

训练时,分类器输入为单个会话的完整特征向量,输出预测的底层 LLM 模型标签。

输出与效率

分类器能跨模型规模与家族泛化,训练仅需少量交互轨迹(如 10 次会话),且能在交互早期(如 5 步内)以高置信度推断代理身份。最终闭集 F1 达 96%。

与同类方法的差异

与以往基于网络流量或 HTTP 头的设备/浏览器指纹不同,本方法仅仅依赖页面可见的用户交互行为,即可识别LLM 代理背后的具体模型型号,揭示了一种新型攻击面;同时探讨了时间延迟防御的局限,指出重新训练可恢复大部分识别能力。

实验

实验设计

  • 环境:覆盖信息检索与购物任务的 4 个网页环境,由 14 个前沿 LLM 驱动的浏览器 agent 执行交互。
  • 数据收集:通过被动 JavaScript tracker 捕获代理的 UI 动作序列交互时间,形成行为轨迹。
  • 分类器:使用 随机森林XGBoost逻辑回归LSTM 对轨迹建模,以识别底层 LLM。
  • 评估策略:封闭集分类、跨模型大小/族泛化、少样本训练、交互早期推断及随机延迟对抗。

关键发现

  • 高识别率:仅凭动作与时间特征,分类器在封闭集上达到 96% F1,远超随机猜测(约 7%)。
  • 信号主导时序特征 是最强信号,但加入随机延迟后,动作特征仍可维持可观的识别能力;重训练延迟数据可使分类器性能大幅恢复。
  • 高效推断:仅需少量交互事件即可训练强分类器,且能在一次交互会话的早期阶段推断出幕后模型。
  • 泛化能力:分类器可跨模型规模与家族泛化,说明指纹特征具有模型族共性,并非针对特定实例。

实战安全启示

  • 定向攻击:网站可基于识别结果利用已知模型漏洞,实施特定模型的 prompt 注入对抗性成本膨胀(如诱导高价操作)。
  • 差异化控制:网站可据此对不同模型实施有区别的访问控制或计费策略。
  • 防御挑战:简单的随机延迟不能根本抵御指纹识别;需要更复杂的对抗混淆技术。

行业影响

落地场景

论文提出的 LLM 代理指纹识别 技术,可直接部署于 Web 安全与流量管理 产品。网站或 CDN 提供商通过植入轻量级 JavaScript 追踪器,即可从代理的 UI 操作序列和时序中识别其底层模型。这能在 反爬虫、反欺诈、API 防护 等场景中,区分真人、普通脚本与不同家族 / 规模的 LLM 代理,并为后续的差异化策略提供依据。此外,该技术也可用于 沙盒测试,评估自有 AI 代理是否过度暴露模型特征,或在 合规审计 中检测未经授权的代理访问。

商业价值

  • 降本:网站可针对性阻滞或误导高频 LLM 抓取流量,降低服务器资源消耗与带宽成本。
  • 增收 / 资产保护:通过识别代理模型并注入模型特有干扰(如 对抗性提示注入 或价格虚高),可保护动态定价、独家内容等敏感资产,间接减少因数据泄露造成的收入损失。
  • 体验提升:对善意自动化服务(如无障碍代理)可放行,避免误伤,维持正常用户体验。

该技术将 LLM 代理的固有行为差异转化为 可量化的安全信号,相比传统基于 IP / UA 的拦截,更难绕过且更具模型针对性

与现有产品 / 工作流的接口

现有安全产品(WAF、Bot Management、API Gateway)可将其作为新增检测模块集成:

  1. 嵌入追踪:在页面或 API 响应中注入 fingerprint.js,采集操作事件、元素定位与时间戳。
  2. 特征工程:将采集到的行为序列实时转换为论文中的 行为特征集(如动作类型分布、交互间隔统计)。
  3. 检测决策:通过已训练的 随机森林XGBoost 分类器在线推断代理身份,输出置信度分数。
  4. 策略联动:根据识别结果执行差异化处置,例如:
    • 对已知脆弱模型推送 诱饵数据提示注入载荷
    • 对高负载代理返回 HTTP 429 或强制延迟,实现 对抗性成本膨胀

模型可定期更新,以应对新 LLM 版本,且训练所需样本量小(few-shot),易于冷启动。

具体应用案例

  • 电商平台防价格抓取:某大型电商网站发现竞争对手通过 LLM 代理批量抓取商品价格。部署本方案后,成功识别出对方使用的 GPT-4o 代理,并通过在响应中注入针对该模型弱点设计的混淆数据,使其抓取结果失真,同时维持正常用户的流畅体验。
  • 内容平台反自动化滥用:一个 UGC 社区面对 LLM 产生的垃圾评论,利用行为指纹区分 ClaudeLlama 等不同模型生成的自动发帖代理,只对检测出的恶意模型实施 CAPTCHA 或限流,降低对真实创作者的影响,并收集攻击样本改善防御策略。

局限

  • **实验场景与模型覆盖有限**:研究虽涉及 14 个前沿 LLM 与 4 个 Web 环境,但任务类型仅限于信息检索与购物,且环境为统一构建的沙箱,未能涵盖真实网站的复杂 DOM 结构、动态内容以及广告拦截器/隐私扩展等实际干扰。随着模型更新与微调,行为模式可能快速变化,分类器对新模型或更新的 agent 策略的泛化能力未经验证,攻击的持久性存疑。
  • **被动 JS 跟踪器在真实部署中受限**:攻击假设页面能无限制执行 JavaScript 以捕获所有 UI 事件和时间,但在实际浏览器中,内容安全策略 (CSP)、跨域隔离、隐私保护机制(如 Brave 的指纹屏蔽)或代理模式下 WebDriver 的限制可能阻断或干扰事件收集。论文未讨论当特征不全时分类器的鲁棒性,以及如何绕过此类防护,这使得攻击在非受控环境下的可行性降低。
  • **防御探索不足**:论文仅演示了注入随机时间延迟的防御,并指出其可被重训练分类器轻易克服,但未提出任何实质性的缓解方案。更复杂的防御(如动作随机化、噪声注入、模拟其他模型的行为)未被研究。工作止于暴露攻击面,但缺乏对防御者视角的指导,弱化了其对构建安全 LLM agent 系统的工程影响力。
论文William Lugoloobi2026-05-14原文

相关内容