Om AI 发布端侧原生 VLX 模型,小参数实现物理世界精准感知
Om AI 的 VLX 模型以端侧原生架构处理视频流,小参数在物理世界感知上超越大模型,展示新路径。
端侧原生意味着模型从架构层就为设备端设计,而非事后压缩。VLX 直接在设备上实时处理连续视频流,输出决策,无需上传云端,从而降低延迟、保护隐私并支持无网环境。其 3B 版本在检测与空间推理上超越多个更大模型,验证了架构创新的价值。
正文摘录
- title: 3B 模型碾压英伟达谷歌后,Om AI 端侧原生 VLX 模型:小参数实现物理世界精准感知 - sourcecompany: 量子位 - bodymarkdown: 响应延迟够不够低?端侧算力能不能承受?部署成本能不能规模化?设备能不能脱离云端独立运行? 因为在物理世界里,每增加一台机器人、无人机或智能终端,都意味着真实的硬件成本、能源成本和维护成本。 如果我们把今天全球物理 AI 模型的路线放在一张地图上会发现,围绕「如何让 AI 理解并行动于物理世界」这一大命题,全球玩家正在形成几条不同方向。 它的核心目标,是帮助 AI 理解物理环境,通过世界模型能力构建更加丰富的空间认知基础。 Physical Intelligence 的 π 系列,则探索「云端通用机器人策略模型」,希望通过大规模训练让机器人具备跨任务泛化能力。 Google Gemini Robotics 则沿着「云端 VLA」方向推进,将语言理解、视觉感知和机器人动作连接起来,让机器人能够根据自然语言完成任务。 而另辟蹊径的 Tesla Optimus,更强调模型与机器人本体之间的闭环,通过自有硬件平台推动机器人能力迭代。 它们分别回答了不同问题:如何让 AI 理解世界?如何让机器人获得通用能力?如何让模型与硬件协同? 其自研的 VLX 端侧流式多模态模型 系列强调「端侧原生」路线,它不依赖云端大算力,也不绑定单一硬件平台。 机器人如果每一次感知都需要上传云端,再等待结果返回,就像让一个人在运动时,每个动作都要先打电话询问远方的大脑。 但工厂里的机器人,需要全天候工作;巡检无人机,需要在没有稳定网络环境的地方执行任务;家庭机器人,需要保护用户隐私。 业内之前的解决方案通常是:先训练一个大模型,再通过压缩、蒸馏、量化等方式,让它适配端侧。