Databricks 用数据工程方法实现视频自然语言搜索
Databricks 通过数据工程流水线,让用户用自然语言查询视频内容,自动截取相关片段并生成文本摘要,极大降低视频分析成本。
传统视频分析依赖人工,耗时且昂贵。Databricks 将视频处理视为数据工程问题,利用视觉语言模型(VLM)和 SAM3 分段模型,让用户通过自然语言查询视频内容,自动截取相关片段并生成文字摘要。整个流程基于 MLflow 实现模型无关,支持灵活替换模型。
正文摘录
by Justin Monaldo , Kacey Hertan and Yvan Aquino 一家公用事业公司部署无人机巡查数百英里的输电线。一个警察局调出数小时交通摄像头画面调查肇事逃逸事故。一个城市规划团队利用摄像头画面分析行人和车流。 每天都会产生 TB 级别的视频数据,这些数据可能提供从运营效率到公共安全等方方面面的宝贵洞察。但几乎没有任何数据得到有意义的分析。因为梳理这些非结构化视频数据极其耗时且昂贵。 想象一下,能够简单地对视频内容大规模应用自然语言查询——不仅是为了找到特定内容,而是分析、评估并从中学习。 Databricks 完全可以支持这一点。方法是什么?把视频当作一个数据工程问题来处理。 传统的视频分析方法是将越来越多的人类分析师投入到问题中。深度学习、计算机视觉,以及最近出现的视觉语言模型(VLMs)的进步,使得计算机能够高精度地识别视频中的物体。但面对海量非结构化数据,进行推理规模化和编排流水线,让组织很难构建这些流水线。尤其是在将 VLMs 应用于这个问题时。VLMs 在提示(prompting)方面提供了灵活性,不需要模型在使用前针对特定类别进行预训练或微调,但比传统的物体检测模型更大更慢,带来了规模化挑战。 在 Databricks 中,你可以专注于如何使用这些模型进行视频分析并将其融入数据流水线,而不是纠结于模型推理和基础设施的复杂性。 这种方法可以通过一个直接部署在 Databricks workspace 中的应用来演示。用户上传一个视频,或指向已存储在 Databricks Volume 中的视频,直接用自然语言输入描述他们要找的内容——例如白色箱式货车、保安人员、太阳能电池板——然后一键启动处理流水线。 之后,Databricks Serverless GPU Compute(SGC)接管。