Jockey by TwelveLabs Jockey 是一款视频 AI 智能体,能理解用户的整个媒体库,通过人物、时刻或上下文搜索照片和视频,适用于个人或开发者,让媒体管理更智能。 热门评论 PH 用户我是Aiden,TwelveLabs的联合创始人兼CTO。今天超级兴奋跟大家分享Jockey。目前大部分媒体搜索仍停留在元数据搜索层面:文件名、时间戳,可能还有老式计算机视觉模型打上的对象标签。这些都无法捕捉到视频里真正发生的内容:场景中有谁、在做什么、上下文、对话、屏幕上的文字。要做到这些,需要能原生理解视频中时间和空间的模型,而不是一堆采样帧。这就是我们的技术栈。我们的embedding模型Marengo,能够将类似“我们差点错过航班的那一瞬间”这样的查询,真正在视频和图片中检索出来,而不是关键词匹配。我们的视频语言模型Pegasus,能根据你定义的schema对整个视频进行分段,并返回带时间戳的结构化片段。Jockey是一个统一的智能体系统,能在你的视频和图片上进行推理:一个推理模型加上一个记忆层,从你的语料库构建知识存储,从而能够分解查询、检索、分段,并在整个库上进行推理。关键在于,它能让你获得可执行的语料级理解。把Jockey指向几千段视频和图片,说“给我剪一个精彩集锦”或“找出最具病毒传播潜力的片段”,它就会返回带时间戳的剪辑,供你直接使用。纯模型方法做不到这一点,因为把一段视频丢进上下文窗口只能处理单个文件,单次前向传播很快就不够用了。它能告诉你关于一段视频的信息,但无法在你的整个目录中推理,也无法从几千段视频中构建集锦。由于我们持续发布和优化模型,Jockey的推理和检索质量会随着新版本推送而提升,这意味着你端不需要重新集成。有两种接入方式:MCP服务器:将Jockey作为Claude中的一个工具连接,直接查询你的库。ChatGPT支持即将推出。API:完全编程访问,可以在你自己的库上构建自定义检索或智能体工作流。这是研究预览版,所以如果你遇到边缘情况(模糊查询、检索遗漏、延迟),我很想听你反馈。随时告诉我们!祝好,AidenPH 用户好名字Aiden!“无需标签”这个卖点正是我想/将要重点测试的部分。自然语言搜索视频对发现来说很棒,但对于合规/法律用例,通常需要确定性的、可审计的类别,而不是模型对场景的最佳猜测。好奇Pegasus的分段对同一片段多次运行时的一致性如何。PH 用户组合查询正是库级视频搜索容易翻车的地方。像‘红色汽车’这种单一概念,用embedding就能很好处理,但‘门刚打开后的那一刻’需要时间定位,平面相似度搜索无法做到。我们构建视频多模态搜索时,因果和顺序查询恰恰是召回率骤降的地方。Jockey的智能体会分解这些多步骤查询并在顺序上进行推理,还是底层检索只是一个单一的embedding查找?PH 用户说实话,搜索效果比我预期的要犀利得多,比如我随便扔了一个烹饪视频进去,它竟然精准抓出了提到“把鸡蛋折进去”的那一瞬间,完全没做任何标签。看到视频理解真的变得实用,感觉挺酷的。PH 用户如果能加一个内置的时间线视图,让你直接跳转到搜索结果在视频中的确切时刻,那就更棒了。目前好像只返回文字版时间戳,有帮助但还得手动拖动。简单来说,一个带高亮匹配片段的可视拖拽条,能省掉很多点击。PH 用户语料库级别的推理是这里有趣的跳跃,大多数视频搜索工具止步于"找到片段",而Jockey更进一步,"推理所有内容并构建整条视频。"我好奇的一点是,与上面的隐私/一致性问题不同:随着你不断向库中添加新素材,Jockey是否只需要嵌入新增内容,还是语料库的增长意味着需要定期重新处理整个库以保持推理层的一致性? 热门产品Jae Lee2026-07-21原文 打开互动版
目前大部分媒体搜索仍停留在元数据搜索层面:文件名、时间戳,可能还有老式计算机视觉模型打上的对象标签。这些都无法捕捉到视频里真正发生的内容:场景中有谁、在做什么、上下文、对话、屏幕上的文字。要做到这些,需要能原生理解视频中时间和空间的模型,而不是一堆采样帧。
这就是我们的技术栈。我们的embedding模型Marengo,能够将类似“我们差点错过航班的那一瞬间”这样的查询,真正在视频和图片中检索出来,而不是关键词匹配。我们的视频语言模型Pegasus,能根据你定义的schema对整个视频进行分段,并返回带时间戳的结构化片段。Jockey是一个统一的智能体系统,能在你的视频和图片上进行推理:一个推理模型加上一个记忆层,从你的语料库构建知识存储,从而能够分解查询、检索、分段,并在整个库上进行推理。
关键在于,它能让你获得可执行的语料级理解。把Jockey指向几千段视频和图片,说“给我剪一个精彩集锦”或“找出最具病毒传播潜力的片段”,它就会返回带时间戳的剪辑,供你直接使用。纯模型方法做不到这一点,因为把一段视频丢进上下文窗口只能处理单个文件,单次前向传播很快就不够用了。它能告诉你关于一段视频的信息,但无法在你的整个目录中推理,也无法从几千段视频中构建集锦。
由于我们持续发布和优化模型,Jockey的推理和检索质量会随着新版本推送而提升,这意味着你端不需要重新集成。
有两种接入方式:MCP服务器:将Jockey作为Claude中的一个工具连接,直接查询你的库。ChatGPT支持即将推出。API:完全编程访问,可以在你自己的库上构建自定义检索或智能体工作流。这是研究预览版,所以如果你遇到边缘情况(模糊查询、检索遗漏、延迟),我很想听你反馈。随时告诉我们!
祝好,
Aiden