论文

VectraYX-Vision-1B: 一个面向西班牙语/拉丁美洲网络安全图像的结构化视觉推理与原生工具使用的 Sub-2B 视觉语言模型

VectraYX-Vision-1B: 一个面向西班牙语/拉丁美洲网络安全图像的结构化视觉推理与原生工具使用的 Sub-2B 视觉语言模型

本文提出 VectraYX-Vision-1B,一个面向西班牙语/拉丁美洲网络安全图像的 Sub-2B 视觉语言模型。该模型通过 MLP 将冻结的 SigLIP-so400m 编码器与 1.04B 西班牙语/拉丁美洲安全解码器耦合。据我们所知,这是首个专门针对网络 UI(如 IDA、Ghidra、Wireshark、Nmap、Metasploit、Volatility)的 Sub-2B VLM,它能够用西班牙语回答,通过原生 <|think| 令牌输出结构化推理,通过 Model Context Protocol(<|toolcall|)调用工具,并可导出为 llama.cpp 的 LLaVA mmproj 格式以支持隔离部署。 我们报告了一个负面的初步视觉 grounding 结果:尽管流程完全可行,当前的视觉 SFT(400–1900 步,约 1600 万令牌)产生的 B6 分数 接近零(工具识别仅 0.08),模型忽略图像内容。我们提出了修复方案(更长 SFT、≥60% 重放、更低学习率),并暴露了一个伪装成训练崩溃的 checkpoint 加载 bug(未去除的 llm. 前缀)。 关键地,我们引入了三变体消融矩阵(V0: NoPE-every-4,V1: 全 RoPE,V2: NoPE+学习 2D),以研究周期性无位置编码(NoPE)层是否有助于或损害对 729 令牌视觉块的注意力。我们提供了文本骨干的 B1–B5、文本对照、初步 B6/B7 分数、墙钟时间、CPU 上的 GGUF 效率,以及一个涵盖 10 个领域的 14,596 个问答对语料库。代码、配置和权重已开源:jsantillana/vectrayx-1b、jsantillana/vectrayx-vision-1b 和 jsantillana/vectrayx-vision-1b-checks,以确立该架构问题的优先权。

论文精读

TL;DR 首个 sub-2B 西班牙语网络安全视觉语言模型,耦合 SigLIP 编码器与 1B 解码器,引入 NoPE 位置编码消融研究;当前视觉 grounding 接近零,但开放权重与架构问题优先权。

问题

问题背景

多模态大模型正从自然图像向专业 GUI 与工具界面延伸,但在网络安全领域,IDA、Ghidra、Wireshark 等工具的截图包含高密度文本与复杂布局,子 2B 规模的视觉-语言模型(VLM)能否实现可靠的视觉接地与工具调用,已成为部署友好型 AI 的关键问题。

现有方法局限

通用 VLM 主要针对自然图像优化,对安全工具 UI 的细粒度理解不足,尤其缺少西班牙语/拉美地区低资源语言支持。更具体地,视觉监督微调在 400–1900 步、约 16M tokens 的规模下,B6 工具识别得分仅 0.08,表明模型几乎忽略图像内容,只依赖文本先验。此外,训练中常遭遇伪崩溃——checkpoint 加载器未剥离 llm. 前缀的 bug 被误认为训练发散。位置编码策略(全 RoPE 与周期性 NoPE)对 729-token 视觉块的注意力影响不明,缺乏系统消融。

为什么这个问题难/重要

安全 UI 图像同时要求 OCR 级文本提取、空间布局理解和工具语义对齐,而子 2B 模型容量有限,通过 MLP 投影对齐视觉 token 并保持语言能力极具挑战。若视觉接地不足,模型可能在高风险场景下误识别工具,导致错误操作。业界对低资源语言安全自动化、离线气隙部署存在现实需求,但小模型视觉失败会直接阻碍落地。作者释放三变体 NoPE 消融矩阵与全部轨迹,为后续研究提供可复现基线,但当前负结果表明短步 SFT 不足以建立图像依赖。

行业类比

类似医学影像 AI 需要图像与结构化报告耦合才能诊断,安全 UI 分析也依赖视觉特征与工具语义深度融合;但网络安全的低资源语言和离线约束使任务更苛刻,可类比边缘端多模态质检的落地困境。

核心洞察

  • 这篇论文最独特的贡献不是模型本身,而是对视觉 grounding 失败的诚实报告与工程归因。同类工作习惯只展示成功结果,本文公开了 B6 视觉基准几乎为零(工具识别仅 0.08)的负面结果,并定位到 checkpoint-loader bug 和训练步数不足,给出补救方案。这种透明度为小模型多模态对齐提供了典型的失败模式和调试路径,降低了社区重复踩坑的成本。
  • NoPE 与视觉注意力交互的 ablation 设计(V0/V1/V2)提出了一个未被充分探究的架构问题。已有研究多在纯语言模型中探讨周期性移除位置编码,而将这一思想引入 VLM 的 729 个视觉 token 块,并与全 RoPE、2D 学习位置编码对比,可能揭示视觉特征是否需要显式位置先验。该工作发布配置和 checkpoint,以 ablation 优先抢占研究优先权,与仅追求 SOTA 的工程导向形成差异。

方法

输入与视觉编码

模型接收 网络安全工具截图(如 IDA、Ghidra、Wireshark、Nmap 等界面),经 冻结 SigLIP-so400m 编码器 提取视觉特征,输出 729 个视觉 token。

投影与语言骨干

MLP 投影层 将视觉 token 映射到语言模型维度,拼接至文本 token 序列,送入 1.04B 西班牙语/LATAM 安全解码器。文本骨干为自回归 Transformer,视觉 token 注入的位置编码策略提供三种消融配置:

  • V0:每 4 层去除位置编码(NoPE)
  • V1:全程 RoPE
  • V2:NoPE + 可学习 2D 位置

推理与工具调用

解码器可输出 原生 <|think|> token 触发结构化推理,或输出 <|tool_call|> token 调用 Model Context Protocol 工具,最终生成西班牙语回答。损失仅对答案 token 计算(loss masking),忽略视觉与提示 token。

训练流程

视觉训练分三阶段:4a 仅训练投影层对齐;4b 联合微调投影与骨干;4c 加入 think/tools 数据。全部权重可导出为 LLaVA mmproj 格式,供 llama.cpp 离线推理。

差异点:与通用 VLM 相比,该模型首次在 sub-2B 规模针对西班牙语网络安全 GUI 场景,系统性地引入 NoPE 位置编码消融,并原生集成结构化推理与 MCP 工具调用。

实验

实验设计

VectraYX-Vision-1B 采用分阶段 SFT:继承文本能力(B1–B5)后进入视觉 4a/4b/4c,分别只训练 MLP 投影、投影+decoder、加入 tool/token。合成多模态语料 14,596 QA 覆盖 10 个安全领域;冻结 SigLIP-so400m 编码器,视觉 token 注入 729 块。同时设计 V0/V1/V2 消融:NoPE-every-4、all-RoPE、NoPE+learned 2D。

关键发现

  • 初步 B6 视觉接地近零,tool-identification 仅 0.08,模型忽略图像内容,但功能管线完整。
  • 发现 checkpoint-loader bug(llm. prefix 未剥离)曾伪装成训练崩溃。
  • 文本基准未退化;GGUF CPU 推理效率已量化。

与基线对比

这是首个 sub-2B 西班牙语网络安全 VLM,无直接同规格基线。负结果说明 400–1900 steps / ~16M tokens 远不足;补救为更长 SFT、≥60% 视觉重放、更低 LR。V0/V1/V2 矩阵为 NoPE 与视觉注意力交互提供优先级,等待补齐。

行业影响

落地场景

  • 安全运营中心 (SOC):分析师面对西班牙语告警与工具截图(IDA、Ghidra、Wireshark),模型可自动解读 UI 元素、生成结构化推理,并输出西班牙语检测摘要,缓解人工跨语言分析压力。
  • 网络安全培训平台:作为虚拟助教,实时解答学员关于逆向工程、网络分析工具界面的操作问题,提升西班牙语学习体验。
  • 恶意软件分析辅助:输入进程树/内存转储截图,模型通过 <|think|> 输出分析步骤,并调用 MCP 工具查询威胁情报。

商业价值

  • 降本:小模型(sub-2B)支持 CPU 推理和 GGUF 量化,硬件门槛低,可部署在边缘或气隙环境;避免依赖大型云端多语言模型,减少 API 调用成本。
  • 提效:将截图解析自动化,缩短事件响应时间;本土语言输出减少翻译环节,提升分析师效率。
  • 合规增收:对于数据敏感行业,本地离线部署能力可满足数据驻留要求,打开西班牙语市场安全产品的差异化卖点。

与现有产品/工作流的接口

  • 导出格式:模型提供 llama.cpp 的 LLaVA mmproj 权重,可直接嵌入 C++/Python 推理栈,兼容现有 GGUF 生态。
  • 工具协议:原生 <|tool_call|> 令牌支持 Model Context Protocol,可无缝对接 SOAR、SIEM 等安全编排平台,作为视觉分析插件。
  • 研究基准:公开的 NoPE×vision 消融矩阵(V0/V1/V2)和训练轨迹,为视觉位置编码研究提供可复现对照,便于社区集成测试。

具体用例

  1. 托管安全服务商 (MSSP):为拉美客户部署该模型,分析师上传可疑网络会话截图,模型生成西班牙语威胁假设并调用 MCP 查询恶意 IP 信誉,输出处理建议。
  2. 在线教育平台:网络安全课程中使用该模型作为自动答疑机器人,学生上传 Wireshark 过滤表达式错误截图,模型解释原因并给出修正语法,全部以西班牙语交互,扩大非英语母语用户覆盖面。

局限

  • - **视觉基础严重不足**:当前视觉 SFT 仅进行 400–1900 步、约 16M tokens,导致 B6 工具识别分数仅 0.08,接近随机水平,模型几乎忽略图像内容。这说明视觉对齐与指令微调远未收敛,多模态能力尚未建立。论文虽提出补救方案(更长 SFT、≥60% 视觉 token 回放、更低学习率),但尚未实施验证。该负面结果使 VLM 的核心视觉理解功能不可用,削弱了实际部署价值。与主流 VLM(如 LLaVA、Qwen-VL)相比,训练数据规模与步数差距悬殊,是明显短板。
  • - **数据合成与语言覆盖缺陷**:模型训练依赖合成 QA 对(14,596 对)和合成图像,存在合成数据与真实网络安全截图(如 IDA、Wireshark 界面)之间的域差距,可能无法处理真实噪声、布局变化和复杂文本密集场景。此外,西班牙语/拉美语言资源有限,部分数据可能通过机器翻译获得,引入翻译伪影,影响模型对专业术语和本地化表达的理解。缺少人工标注或真实用户数据验证,QA 质量存疑,限制了模型在真实事件响应中的可靠性。
  • - **架构与评估局限性**:视觉编码器 SigLIP-so400m 被完全冻结,不参与梯度更新,限制了模型对网络安全特定视觉特征的适配能力,可能成为性能上限。模型仅支持单图像、单轮交互,无法处理多轮对话、多图像关联或视频序列,与实际安全分析工作流差距较大。此外,评估采用单种子、缺乏多轮平均,且早期检查点加载器 bug(未剥离 `llm.` 前缀)导致部分结果不可靠,虽已发现但可能影响了消融实验的解释。安全与对抗鲁棒性未做评估,工具调用仅通过合成数据评估,真实 MCP 集成未测试。
论文Juan S. Santillana2026-08-09原文

相关内容