开源项目

video-search-and-summarization

video-search-and-summarization

NVIDIA 推出的视频搜索与摘要参考架构,整合 Vision Agent 与 AI 视频分析能力,支持实时视频智能、下游分析和 Agent 离线处理。亮点在于基于 NVIDIA NIM 微服务,提供 Q&A、告警验证、搜索和长视频摘要等多种开箱即用工作流,适合快速搭建 GPU 加速的视频分析应用。需 NVIDIA AI Enterprise 开发者许可。

README

NVIDIA AI Blueprint:视频搜索与摘要(VSS)

目录

概述

NVIDIA 视频搜索与摘要 Blueprint(VSS) 提供了一套参考架构,用于构建视觉智能体(vision agents)和由 AI 驱动的视频分析应用。这些架构集成了加速视觉微服务、视觉语言模型(VLM)和大语言模型(LLM),使您能够将它们用于现有应用、作为独立微服务或作为更大规模视觉智能体的一部分。

VSS 分为三个处理与分析领域:实时视频智能(特征提取、嵌入(embeddings)以及流理解,结果发布到消息代理(message broker))、下游分析(将元数据丰富化为轨迹、事件和已验证告警)以及智能体与离线处理(用于搜索、问答、摘要和片段检索的编排工具,包括通过模型上下文协议(Model Context Protocol, MCP))。

本仓库实现了该 blueprint,并为基于自然语言的视频智能体(搜索、摘要、视觉问答及相关工作流)提供支持,底层依托生成式 AI、VLM、LLM 以及按下方堆栈配置的 NVIDIA NIM 微服务。

用例/问题描述

NVIDIA AI Blueprint for Video Search and Summarization 解决了部署视觉智能体以处理大量视频数据(包括存储的和流式的)的挑战。该 blueprint 可用于创建视觉 AI 智能体,适用于多种场景,例如监控智慧空间、仓库自动化以及 SOP 验证。这在快速、准确的视频分析能够带来更好决策和更高运营效率的场景中至关重要。

智能体工作流

我们提供了多个参考 智能体工作流,展示了智能体如何利用各个组件:

工作流 描述
问答与报告生成(快速入门) 针对短视频片段进行视频检索、基于 VLM 的问答和报告生成
告警验证 使用感知(目标检测、跟踪)和行为分析实时处理视频,生成告警,随后通过 VLM 验证以减少误报
实时告警 通过 VLM 持续处理视频流以进行异常检测
视频搜索 使用视频嵌入(video embeddings)跨视频档案进行自然语言搜索(alpha 阶段)
长视频摘要 通过分块和密集字幕聚合对长时间视频记录进行分析和摘要生成

软件组件

  1. NIM 微服务:以下是本 blueprint 中使用的模型:

  2. 实时视频智能:实时视频智能层从视频数据中实时提取丰富的视觉特征、语义嵌入和上下文理解,并将结果发布到消息代理(message broker),供下游分析和智能体工作流使用。它提供了三个核心微服务用于处理视频流。

  3. 下游分析:下游分析层处理并丰富实时视频智能微服务生成的元数据流,将原始检测结果转换为可操作的见解和已验证的告警。

  4. 智能体与离线处理:顶层智能体利用模型上下文协议(MCP)通过统一工具接口访问视频分析数据、事件记录和视觉处理能力。它集成了多种基于视觉的工具,包括使用视觉语言模型(VLM)进行视频理解、使用嵌入进行语义视频搜索、用于长时间片段分析的长视频摘要,以及视频快照/片段检索。

目标受众

本 blueprint 设计为易于设置,并提供广泛的配置选项,但需要技术专业知识。其目标用户包括:

  1. 视频分析师和 IT 工程师:专注于分析视频数据并确保高效处理与摘要的专业人士。blueprint 提供一键部署步骤、易于管理的配置以及即插即用的模型,适合早期开发者。

  2. 生成式 AI 开发者 / 机器学习工程师:需要针对特定用例定制 blueprint 的专家。包括修改流水线以适应独特数据集以及根据需要微调 LLM。对于高级用户,blueprint 提供详细的配置选项和自定义部署可能性,支持广泛的定制和优化。

仓库结构概览

目录 描述
agent/ 视频搜索与摘要智能体(Python)。包含 src/vss_agents/(工具、智能体、API、嵌入、评估器、视频分析)、tests/、stubs/、docker/ 和 3rdparty/。详见 agent/README.md。
deployments/ 部署配置和 Docker Compose:NIM 模型配置(nim/)、开发者工作流(developer-workflow/ — dev-profile-base、dev-profile-search、dev-profile-alerts、dev-profile-lvs)、基础服务、LVS、RTVI、VLM-as-verifier、VST 以及根 compose.yml。
scripts/ 部署和补丁脚本,包括 Brev 可启动 notebook(deploy_vss_launchable.ipynb)以及 dev-profile / 补丁脚本。
skills/ agentskills.io 兼容的 VSS 智能体技能(skills):每个技能一个独立子目录,包含带有 SKILL.md 前置元数据。涵盖搜索、摘要、告警、VIOS、RT-VLM、LVS 及其他相关工作流的部署与使用——请参阅 skills/README.md 中的目录和安装说明。
ui/ 前端 monorepo(Next.js, Turbo):apps/(nemo-agent-toolkit-ui、nv-metropolis-bp-vss-ui)和共享的 packages/。详见 ui/README.md。

文档

关于本 blueprint 的详细说明和其他信息,请参阅官方文档。

前提条件

获取 API 密钥

硬件要求

平台要求可能因 VSS 使用的配置和部署拓扑以及 VLM、LLM 等依赖项而异。有关经过验证的 GPU 拓扑以及应使用的配置列表,请参阅 GPU 要求。

快速入门指南

可启动部署

适合:无需担心硬件和软件要求,快速开始使用自己的视频。

按照 文档 和 scripts 目录中的 notebook 中的步骤,使用 Brev Launchable 在 2xRTX PRO 6000 SE AWS 实例上完成所有前提条件并部署 blueprint。

Docker Compose 部署

适合:在您自己的硬件或裸金属云实例上部署 VSS 智能体。

系统要求
  • 操作系统:
    • x86 主机:Ubuntu 22.04 或 Ubuntu 24.04
    • DGX-SPARK:DGX OS 7.4.0
    • IGX-THOR:Jetson Linux BSP (Rel 38.5)
    • AGX-THOR:Jetson Linux BSP (Rel 38.4)
  • NVIDIA 驱动:
    • 580.105.08(x86 主机,Ubuntu 24.04)
    • 580.65.06(x86 主机,Ubuntu 22.04)
    • 580.95.05(DGX-SPARK)
    • 580.00(IGX-THOR 和 AGX-THOR)
  • NVIDIA Container Toolkit:1.17.8+
  • Docker:27.2.0+
  • Docker Compose:v2.29.0+
  • NGC CLI:4.10.0+

请参阅此处的前提条件章节获取安装细节。

许可证

请参阅 LICENSE

开源项目NVIDIA-AI-Blueprints2026-05-14原文

相关内容