video-use
通过 Claude Code 等 AI 编程 agent 自动剪辑视频的工具,只需把原始素材放入文件夹,用自然语言描述需求,就能自动完成去填充词、调色、加字幕、生成动画覆盖层等操作。亮点在于 agent 不直接“看”视频,而是通过语音转录文本和时间轴可视化图进行决策,避免处理海量帧数据,效率极高。支持自我评估渲染结果,且完全开源,适合视频创作者快速产出成品。
README
video-use
介绍 video-use —— 使用 Claude Code 编辑视频。100% 开源。
将原始素材放入文件夹,与 Claude Code 对话,即可获得 final.mp4。适用于任何内容 —— 人物讲话、蒙太奇、教程、旅行、采访 —— 无需预设或菜单。
功能概述
- 去除填充词(
umm、uh、错误起词)以及拍摄间隔中的空白静默 - 自动调色每个片段(暖调电影风、中性冲击或任意自定义 ffmpeg 链)
- 每次剪辑处加入 30 毫秒音频淡入淡出,杜绝爆音
- 烧录字幕,可按你的风格定制 —— 默认使用两词大写块(2-word UPPERCASE chunks),完全可自定义
- 通过 HyperFrames、Remotion、Manim 或 PIL 生成动画叠加层 —— 每个动画由并行子 agent 独立生成
- 在向你展示任何内容之前,先在每个剪辑边界自我评估渲染输出
- 将会话记忆持久化到
project.md,方便下周的会话从上次中断处继续
设置提示
粘贴到 Claude Code、Codex、Hermes、Openclaw 或任何具有 shell 权限的 agent 中:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agent 会自动处理克隆、依赖安装、技能注册,并提示你输入 ElevenLabs API 密钥(前往 elevenlabs.io/app/settings/api-keys 获取)。
然后,将你的 agent 指向包含原始素材的文件夹:
cd /path/to/your/videos
claude # 或 codex、hermes 等
若希望在自己的 VPS 或 Telegram 上实现常在线编辑,可通过 Browser Use Box 运行 agent。观看 15 秒演示。
在会话中:
edit these into a launch video
它将清点源文件,提出策略,等待你确认,然后在源文件旁生成 edit/final.mp4。所有输出均存放在 <videos_dir>/edit/ —— 技能目录保持整洁。
手动安装
若希望手动操作:
# 1. 克隆并创建符号链接至 agent 的技能目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 安装依赖
cd ~/Developer/video-use
uv sync # 或:pip install -e .
brew install ffmpeg # 必需
brew install yt-dlp # 可选,用于下载在线源
# 3. 添加你的 ElevenLabs API 密钥
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
工作原理
LLM 从不观看视频。它通过两个层 读取 视频,这两个层共同为其提供从词边界精确剪辑所需的一切。
第一层 —— 音频转录文本(始终加载)。 每个源文件调用一次 ElevenLabs Scribe,获得词级别时间戳、说话人分离和音频事件((laughter)、(applause)、(sigh))。所有片段被打包进一个约 12KB 的 takes_packed.md 文件 —— 这是 LLM 的主要阅读视图。
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
第二层 —— 视觉合成图(按需生成)。 timeline_view 为任意时间范围生成一张包含胶片条、波形和词标签的 PNG。仅在决策点调用 —— 含混的停顿、镜头比较、剪辑点合理性检查。
朴素做法:30,000 帧 × 1,500 tokens = 4500 万 token 的噪声。 Video Use:12KB 文本 + 几张 PNG。
与 browser-use 一样:给 LLM 结构化 DOM 而非截图 —— 但对于视频。
流水线
转录 ──> 打包 ──> LLM 推理 ──> EDL ──> 渲染 ──> 自我评估
│
└─ 发现问题?修复并重新渲染(最多 3 次)
自我评估循环会在每个剪辑边界对 渲染输出 运行 timeline_view —— 捕获视觉跳跃、音频爆音、隐藏字幕。仅当通过后才向你展示预览。
设计原则
- 文本 + 按需视觉。 不倾泻帧画面。转录文本就是表面。
- 音频优先,视觉跟随。 剪辑来自语音边界和静音间隙。
- 询问 → 确认 → 执行 → 自我评估 → 持久化。 未经策略批准绝不触碰剪辑。
- 对内容类型零假设。 观察、询问,再编辑。
- 12 条硬规则,其余保留艺术自由。 生产正确性不可妥协。品味则不在约束之列。
详见 SKILL.md 获取完整的制作规则和剪辑技巧。