行业新闻

杭州Om AI开源VLX,实现端侧流式多模态感知与行动

Om AI的VLX系统把持续感知、定位和行动决策整合在端侧,让模型从“看图说话”升级为“实时做事”。

全球首个将DeepSeek R1强化学习引入视觉语言模型的开源项目VLX,由Om AI团队发布,上线12小时获2000+ GitHub星标。它由Flow(持续感知)、Seek(精准定位)、Go(行动规划)三模型组成,专为端侧实时视频流设计,让AI从「看图说话」升级为「持续感知并驱动行动」。

正文摘录

作为全球首个将 DeepSeek R1 强化学习范式引入视觉语言模型的开源项目,上线 12 小时获得超过 2000 颗 GitHub Star。 为了更好地理解 VLX 这次的技术路线,我们可以把它拆成两个关键词:端侧 与 流式多模态。 所谓流式多模态,就是让 AI 能够在物理世界中持续、实时地感知环境,并最终形成一条完整的能力链: 感知(Perception)→ 精准定位(Grounding)→ 行动(Action)。 语音助手强调的是人与 AI 的实时交互,而 VLX 关注的,则是 AI 在物理世界中持续观察、持续判断,并最终驱动行动,完成从“看图”到“做事”的跨越。 随着 具身智能、空间智能、视频生成 等领域快速发展,VLM 已经不再只是 LLM 的一个能力模块,而是在逐渐成为空间理解、视频理解乃至动作规划的新一代基础设施。 这意味着,VLM 不仅需要看图说话,更需要具备持续感知、精准定位和驱动行动的能力,从而为下游任务提供统一、精准的基座能力。 数据显示,VLM/多模态相关论文占比已经从去年的 4.9% 增长到 10.6%,几乎翻倍,成为近年来增长最快的研究方向之一。 而在论文数量快速增长的背后,最值得关注的两个关键词,就是 实时感知(Streaming) 和 定位(Grounding)。 (注:Grounding 的核心就是让模型根据一句自然语言描述,准确找到图像或视频中对应的对象、区域和概念) 一次性的观察,很难应对这样 动态、开放且持续变化 的环境。因此,模型必须像人一样不断接收新信息、持续更新对环境的理解。 让画面像水流一样持续涌入,靠增量编码和缓存机制不断更新自己的视觉状态,既不用反复重算历史,也不会因为视频变长而失忆。

阅读原文(qbitai.com)→

行业新闻henry2026-06-27原文

相关内容