介绍LLM通过音频转录和视觉复合实现精确视频剪辑
工作原理
LLM 从不观看视频。它通过两个层级来读取视频——这两个层级共同提供所需的一切信息,使其能够以词边界精度进行剪辑。
第一层——音频转录(始终加载)。每个源调用一次 ElevenLabs Scribe,提供词级时间戳、说话人分离和音频事件((笑声)、(掌声)、(叹息))。所有拍摄片段打包成一个约 12KB 的 takes_packed.md 文件——这是 LLM 的主要阅读视图。
第二层——视觉复合(按需)。timeline_view 为任意时间范围生成包含胶片条、波形和单词标签的 PNG 图像。仅在决策点调用——模糊停顿、拍摄比较、剪辑点合理性检查。
与 browser-use 让 LLM 访问结构化 DOM 而非截图的想法相同——但这次是针对视频。
LLM 从不观看视频。它通过两个层级来读取视频——这两个层级共同提供所需的一切信息,使其能够以词边界精度进行剪辑。
第一层——音频转录(始终加载)。每个源调用一次 ElevenLabs Scribe,提供词级时间戳、说话人分离和音频事件((笑声)、(掌声)、(叹息))。所有拍摄片段打包成一个约 12KB 的 takes_packed.md 文件——这是 LLM 的主要阅读视图。
第二层——视觉复合(按需)。timeline_view 为任意时间范围生成包含胶片条、波形和单词标签的 PNG 图像。仅在决策点调用——模糊停顿、拍摄比较、剪辑点合理性检查。
与 browser-use 让 LLM 访问结构化 DOM 而非截图的想法相同——但这次是针对视频。