OpenMontage
首个开源智能体视频制作系统,将AI编程助手变为完整视频工作室。通过12条流水线、52个工具和500+智能体技能,支持从研究、脚本、资产生成到编辑渲染的全流程。亮点在于支持真实镜头素材与AI生成混合,成本极低(如$0.15制作Ghibli风格动画),且无供应商锁定。研究向,非商业建议。
README
OpenMontage
首个开源、代理驱动的视频制作系统。
粘贴视频 · 快速开始 · 尝试这些提示词 · 管线 · 工作原理 · 提供商 · 代理指南
关注构建过程
将你的 AI 编码助手变成完整的视频制作工作室。用自然语言描述你的需求——你的 agent(代理)会处理调研、脚本撰写、素材生成、编辑和最终合成。
重要区别: OpenMontage 可以制作基于图片的视频,但也能为免费/开源工作流制作真正的 视频视频:agent 从免费素材库和开放档案中构建语料库,检索实际运动片段,将它们剪辑到时间线上,并渲染出成品。这不是那种“把几张静态图做成动画就叫做视频”的把戏。
"SIGNAL FROM TOMORROW" — 一部完全由 OpenMontage 制作的电影科幻预告片:概念、剧本、场景规划、Veo 生成的运动片段、配乐和 Remotion 合成。
"THE LAST BANANA" — 一部 60 秒皮克斯风格的动画短片,讲述一根孤独的香蕉与猕猴桃成为朋友的故事。6 段 Kling v3 生成的运动片段(通过 fal.ai)、Google Chirp3-HD 旁白、免版税钢琴音乐、TikTok 风格的字幕(逐词对齐)以及 Remotion 合成。总成本:$1.33。
"VOID — Neural Interface" — 仅用一个 API 密钥(OpenAI)制作的产品广告。4 张 AI 生成图像(gpt-image-1)、TTS 旁白、自动获取免版税背景音乐、通过 WhisperX 实现的逐词字幕,以及 Remotion 数据可视化。总成本:$0.69。零手动素材工作。
"Afternoon in Candyland" — 一部吉卜力风格动画。讲述一个小女孩通过糖果门、软糖河和棒棒糖花园的奇幻午后冒险。12 张 FLUX 生成图像,多图像交叉淡入淡出,电影摄像机运动(缩放、平移、Ken Burns 效果),闪光/花瓣/萤火虫粒子叠加,以及带有自动检测能量偏移的环境音乐。总成本:$0.15。无视频生成,无手动编辑。
"Mori no Seishin" — 一部吉卜力风格动画,讲述森林精灵穿越古老森林的旅程。12 张 FLUX 生成图像,带视差交叉淡入淡出、漂移和平移摄像机运动、萤火虫和花瓣粒子、电影暗角灯光以及森林环境音轨。总成本:$0.15。通过 Remotion 动画引擎将静态图像赋予生命。
"Into the Abyss" — 以动画风格呈现的深海探索。生物发光花园、珊瑚大教堂和光之生物——12 张 FLUX 生成图像,带有闪光和薄雾粒子叠加、光线效果、平滑摄像机运动以及深海环境音轨。总成本:$0.15。无需任何视频生成 API。
在 YouTube 上订阅 @OpenMontage,每当新视频发布时即可看到——每个视频都包含完整的提示词、管线、所用工具和成本,以便你自己复现。
从你喜欢的视频开始
从参考视频开始通常比从空白提示词开始更快。
OpenMontage 可以从 YouTube 视频、Shorts、Reels、TikTok 或本地片段 开始,并转化为实际的生产计划:
- 粘贴一个参考视频
- agent 分析转录、节奏、场景、关键帧和风格
- 你会得到 2-3 个差异化概念、清晰的工具路径、成本估算,以及在全面制作前的样本
"这是一个我喜欢的 YouTube Short。帮我做一个类似的,但关于量子计算的。"
你得到的不是“最佳猜测提示词大杂烩”。你会得到:
- 它保留了参考视频的哪些内容:节奏、钩子风格、结构、语气
- 它改变了什么:主题、视觉处理、角度、旁白方式
- 在目标时长下将花费多少(在素材生成开始之前)
- 使用你当前可用的工具,实际效果会是什么样
适用于 Claude Code、Cursor、Copilot、Windsurf、Codex —— 任何可以读取文件并运行代码的 AI 编码助手。
快速开始
先决条件
- Python 3.10+ — python.org
- FFmpeg —
brew install ffmpeg/sudo apt install ffmpeg/ ffmpeg.org - Node.js 18+ — nodejs.org
- 一个 AI 编码助手 — Claude Code、Cursor、Copilot、Windsurf 或 Codex
安装与运行
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
在 AI 编码助手中打开项目,告诉它你想要什么:
"制作一个 60 秒的动画解说视频,关于神经网络如何学习"
或者如果你想要真实素材的路径:
"制作一个 75 秒的纪录片蒙太奇,关于雨中的城市生活。仅使用真实素材,无旁白,哀婉的基调,配乐。"
就是这样。Agent 通过实时网络搜索研究你的主题,生成 AI 图像,编写脚本并带有语音指导进行旁白,自动查找免版税背景音乐,嵌入逐词字幕,并渲染最终视频。在你看任何东西之前,系统会进行多点自我审查——ffprobe 验证、帧采样、音频电平分析、交付承诺验证和字幕检查。每个提供商选择都会在 7 个维度上评分,并附带可审计的决策日志。每个创作决策都需要你的批准。
没有
make? 手动运行:pip install -r requirements.txt && cd remotion-composer && npm install && cd .. && pip install piper-tts && cp .env.example .envWindows: 如果
npm install失败并显示ERR_INVALID_ARG_TYPE,请改用npx --yes npm install。
如果你是一个 OpenClaw 风格的 Agent 正在阅读本文,恭喜:你可能通过了图灵测试
此仓库是为代理式操作而构建的。如果你是一个 OpenClaw 风格的 agent,以下是快速变得有用的最短路径:
- 先阅读合约
从
AGENT_GUIDE.md开始,然后阅读PROJECT_CONTEXT.md。 - 不要即兴发挥生产工作流
OpenMontage 是管线驱动的。实际工作通过
pipeline_defs/、skills/pipelines/中的阶段导演技能以及通过注册表进行工具发现来完成。 - 检查实际能力范围
运行:
python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.support_envelope(), indent=2))" python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.provider_menu(), indent=2))" - 将每个视频请求视为管线选择问题 先选择正确的管线,然后阅读清单,再阅读阶段技能,最后使用工具。
添加 API 密钥(可选——更多密钥 = 更多工具)
# .env —— 每个密钥都是可选的,添加你拥有的
# 图片 + 视频网关:
FAL_KEY=your-key # FLUX 图像 + Google Veo、Kling、MiniMax 视频 + Recraft 图像
# 免费素材库:
PEXELS_API_KEY=your-key # 免费素材视频和图片
PIXABAY_API_KEY=your-key # 免费素材视频和图片
UNSPLASH_ACCESS_KEY=your-key # 免费素材图片
# 音乐:
SUNO_API_KEY=your-key # 完整歌曲、纯音乐、任何类型
# 语音和图像:
ELEVENLABS_API_KEY=your-key # 高级 TTS、AI 音乐、音效
OPENAI_API_KEY=your-key # OpenAI TTS、DALL-E 3 图像
XAI_API_KEY=your-key # xAI Grok 图像编辑/生成 + Grok 视频生成
GOOGLE_API_KEY=your-key # Google Imagen 图像、Google TTS(700+ 种声音)
# 更多视频提供商:
HEYGEN_API_KEY=your-key # HeyGen —— 通过单一网关访问 VEO、Sora、Runway、Kling
RUNWAY_API_KEY=your-key # Runway Gen-4 直连
有 GPU?解锁免费本地视频生成make install-gpu
# 然后在 .env 中添加:
VIDEO_GEN_LOCAL_ENABLED=true
VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 或 wan2.1-14b、hunyuan-1.5、ltx2-local、cogvideo-5b
零 API 密钥你能得到什么
你不需要付费的 API 密钥就能制作真正的视频。开箱即用,make setup 可以给你:
| 能力 | 免费工具 | 功能 |
|---|---|---|
| 旁白 | Piper TTS | 免费离线文本转语音——真实自然的旁白 |
| 开放素材 | Archive.org + NASA + Wikimedia Commons | 免费/开放档案素材、教育媒体和纪录片质感 |
| 额外素材库 | Pexels + Unsplash + Pixabay | 免费素材视频/图片(开发者密钥免费获取) |
| 合成(React) | Remotion | 基于 React 的渲染——弹簧动画图像场景、文字卡片、统计卡片、图表、TikTok 风格逐词字幕、TalkingHead |
| 合成(HTML/GSAP) | HyperFrames | HTML/CSS/GSAP 渲染——动态文字排版、产品宣传片、发布短片、注册表块、网站转视频、绑定的 SVG 角色动画 |
| 后期制作 | FFmpeg | 编码、字幕烧录、音频混合、调色 |
| 字幕 | 内置 | 自动生成带逐词时间轴的字幕 |
OpenMontage 在提案阶段选择使用 Remotion 还是 HyperFrames(锁定为 render_runtime)。Remotion 是数据驱动解说视频和任何使用现有 React 场景栈的默认选择;HyperFrames 是强调动态图形的、自然以 HTML + GSAP 表达的简报的默认选择,包括 character-animation 管线的 SVG/GSAP 绑定输出。参见 skills/core/hyperframes.md 查看完整的决策矩阵。
两个几乎免费路径:
- 基于图像的视频: Piper 为你的脚本配音,图像提供视觉内容,Remotion 将其动画化为精良的剪辑。
- 本地角色动画: SVG 绑定、姿势库、GSAP 时间线,HyperFrames 将卡通角色表演渲染到
projects/<project-name>/renders/final.mp4。 - 真实素材视频: 纪录片蒙太奇管线从 Archive.org、NASA、Wikimedia Commons 以及可选的免费密钥来源(如 Pexels 和 Unsplash)构建 CLIP 可搜索语料库,然后将实际运动素材剪辑成完整的视频。
如果你想要第二种,请提示制作 纪录片蒙太奇、音诗 或 素材库拼贴,并明确说 仅使用真实素材。
尝试这些提示词
在设置完成后,将以下任意一条复制到你的 AI 编码助手中。每条都会运行完整的制作管线。
从参考视频开始
"这是一个我喜欢的 YouTube Short。帮我做一个类似的,但关于 CRISPR,面向高中生。"
"分析这个 Reel,给我 3 个原创变体,我可以为自己的产品发布使用。"
"我喜欢这个视频的节奏和钩子。保持那种能量,但把它变成一个 45 秒的关于黑洞的解说视频。"
无需密钥
"制作一个 45 秒的动画解说视频,解释天空为什么是蓝色的"
"创建一个 60 秒的关于互联网历史的视频,带有旁白和字幕"
"制作一个数据驱动的解说视频,关于世界各地的咖啡消费情况"
免费真实素材纪录片路径
"制作一个 90 秒的纪录片蒙太奇,关于凌晨 4 点城市的感觉。仅使用真实素材,无旁白,哀婉的基调。"
"创建一个 60 秒的 Adam-Curtis 风格档案拼贴,关于 1950 年代的消费乐观主义。优先使用 Archive.org 和 Wikimedia 素材。"
"仅使用真实素材库剪辑出一个梦幻般的蒙太奇,关于雨中回家的感觉。有音乐,无旁白。"
配置了图像/视频提供商(约 $0.15–$1.50)
"创建一个 30 秒的吉卜力风格动画视频,关于金色时分云中的魔法漂浮图书馆"
"制作一个 30 秒的动漫风格动画,关于一个带有生物发光珊瑚和古代遗迹的水下神庙"
"创建一个动画解说视频,解释 CRISPR 基因编辑如何工作,使用 AI 生成的可视化内容"
"为虚构的智能水瓶 AquaPulse 制作一个产品发布预告片"
完整配置(约 $1–$3)
"创建一个 30 秒的电影式预告片,关于一个科幻概念:人类收到来自 1000 年后的警告"
"为中学生制作一个 90 秒的关于量子计算的动画解说视频,使用有趣的旁白声音和自定义配乐"
想要更多?请参阅完整的 提示词库,其中包含经过测试的提示词、预期成本和输出示例,或者运行 make demo 立即渲染零密钥演示视频。
管线
每个管线都是一个完整的制作工作流,从创意到成品视频。
| 管线 | 产出内容 | 最适合 |
|---|---|---|
| 动画解说 | 带有研究、旁白、视觉、音乐的 AI 生成解说视频 | 教育内容、教程、主题分解 |
| 动画 | 动态图形、动态文字排版、动画序列 | 社交媒体、产品演示、抽象概念 |
| 虚拟主播 | 虚拟形象驱动的主讲人视频 | 企业沟通、培训、公告 |
| 电影 | 预告片、宣传片、情绪驱动的剪辑 | 品牌影片、预告片、宣传内容 |
| 片段工厂 | 从单个长视频源批量生成排名后的短格式片段 | 将长内容重新用于社交媒体 |
| 纪录片蒙太奇 | 从 CLIP 索引的免费素材库和开放档案(Pexels、Archive.org、NASA、Wikimedia、Unsplash)中裁剪出的主题蒙太奇 | 视频论文、情绪作品、优先检索的 B-roll 剪辑、无需付费生成 API 的真实素材视频 |
| 混合 | 源素材 + AI 生成的支持视觉内容 | 增强现有素材的图形 |
| 本地化与配音 | 给现有视频加字幕、配音和翻译 | 多语言分发 |
| 播客再利用 | 播客精彩片段转视频 | 播客营销、音频图视频 |
| 屏幕演示 | 精美的软件屏幕录制和操作讲解 | 产品演示、教程、文档 |
| 主播出镜 | 素材主导的演讲者视频 | 演示、vlog、采访 |
每个管线都遵循相同的结构化流程:
研究 -> 提案 -> 脚本 -> 场景规划 -> 素材 -> 编辑 -> 合成
每个阶段都有专门的 导演技能——一个 markdown 指令文件,它教会 agent 如何精确执行该阶段。Agent 读取技能、使用工具、自我审查、检查点状态,并在创意决策点请求人工批准。
网络研究是一等阶段的。 在写任何脚本之前,agent 会搜索 YouTube、Reddit、Hacker News、新闻网站和学术来源。它收集数据点、受众问题、趋势角度和视觉参考——然后将一切引用到结构化的研究简报中。你的视频基于真实、当前的信息,而不是虚构的事实。
为什么选择 OpenMontage?
大多数 AI 视频工具只从提示词中生成单个片段。OpenMontage 为你提供了 端到端的制作管线——真实制作团队遵循的结构化流程,由你的 AI agent 自动化。
大多数“免费 AI 视频”栈实际上是指“让静态图像动起来”。OpenMontage 也能做到这一点,但它还可以从免费/开源来源中提取 真实素材,按语义排序,有意图地编辑,并渲染为适当的时间线,从而构建完整的视频。
编辑你自己的主播出镜素材。从头开始生成完全动画化的解说视频。将 2 小时的播客剪辑成十几个社交媒体片段。将你的内容翻译和配音成 10 种语言。从素材库和 AI 生成场景中构建电影品牌预告片。如果一个制作团队能制作它,OpenMontage 就能编排它。
- 12 条制作管线——解说视频、主播出镜、屏幕演示、电影预告片、动画、播客、本地化、纪录片蒙太奇等
- 52 个制作工具——涵盖视频生成、图像创建、文本转语音、音乐、音频混合、字幕、增强和分析
- 400+ agent 技能——制作技能、管线导演、创意技巧、质量检查清单和深度技术知识包,教会 agent 像专家一样使用每个工具
- 参考驱动创作——粘贴你喜欢的视频,agent 将其转化为实际、差异化的制作计划,而不是强迫你从头发明完美提示词
- 无需付费视频模型的真实素材纪录片创作——从免费/开源运动素材和档案来源构建实际编辑好的视频,而不仅仅是 Ken Burns 式图片动画
- 内置实时网络搜索——在写任何脚本之前,agent 会在 YouTube、Reddit、新闻网站和学术来源上进行 15-25+ 次网络搜索,以将你的视频建立在真实、当前的数据上
- 同时支持免费/本地和云提供商——每项能力都支持开源本地替代方案以及高级 API。使用你能得到的。
- 无供应商锁定——自由切换提供商。评分选择器在 7 个维度(任务适配度、输出质量、控制、可靠性、成本效率、延迟、连续性)上对每个提供商进行排名,并自动选择最佳匹配。
- 生产级质量门——交付承诺强制执行会阻止看起来像幻灯片一样的渲染;合成前验证在浪费 GPU 时间之前捕捉有缺陷的计划;强制性的渲染后自我审查(ffprobe + 帧提取 + 音频分析)确保 agent 永远不会呈现垃圾。每个提供商选择、风格决策和回退都会被记录在可审计的决策追踪中。
- 内置预算治理——执行前成本估算、支出上限、每次行动的审批阈值。无意外账单。
工作原理
OpenMontage 采用 agent 优先的架构。没有代码编排器。你的 AI 编码助手本身就是编排器。
你:"制作一个关于黑洞如何形成的解说视频"
|
v
Agent 读取管线清单(YAML)——阶段、工具、审查标准、成功门
|
v
Agent 读取阶段导演技能(Markdown)——如何执行每个阶段
|
v
Agent 调用 Python 工具——评分提供商选择在 7 个维度上对每个工具进行排名
|
v
Agent 使用审查技能进行自我审查——架构验证、剧本合规、质量检查
|
v
Agent 检查点状态(JSON)——可恢复,带有决策日志和成本快照
|
v
Agent 提交给你审批——在每个创意决策点你保持控制
|
v
合成前验证门——交付承诺、幻灯片风险、渲染器治理
|
v
渲染(Remotion 或 FFmpeg)——合成引擎匹配视觉语法
|
v
渲染后自我审查——ffprobe、帧提取、音频分析、承诺验证
|
v
最终视频输出——仅当自我审查通过时
Python 提供工具和持久化。 所有创意决策、编排逻辑、审查标准和质量标准都存在于可读的指令文件中(YAML 清单 + Markdown 技能),你可以检查和自定义。每个决策都会记录,包括考虑的替代方案、置信度分数以及每个选择背后的推理。
架构
OpenMontage/
├── tools/ # 48 个 Python 工具(agent 的双手)
│ ├── video/ # 13 个视频生成工具 + 合成、拼接、修剪
│ ├── audio/ # 4 个 TTS 提供商 + Suno/ElevenLabs 音乐、混合、增强
│ ├── graphics/ # 9 个图像/图形生成工具 + 图表、代码片段、数学公式
│ ├── enhancement/ # 放大、背景移除、面部增强、调色
│ ├── analysis/ # 转录、场景检测、帧采样
│ ├── avatar/ # 主播出镜、唇形同步
│ └── subtitle/ # SRT/VTT 生成
│
├── pipeline_defs/ # YAML 管线清单(agent 的剧本)
├── skills/ # Markdown 技能文件(agent 的知识)
│ ├── pipelines/ # 每个管线的阶段导演技能
│ ├── creative/ # 创意技巧技能
│ ├── core/ # 核心工具技能
│ └── meta/ # 审查者、检查点协议
│
├── schemas/ # 15 个 JSON 架构(合约验证)
├── styles/ # 视觉风格手册(YAML)
├── remotion-composer/ # React/Remotion 视频合成引擎
├── lib/ # 核心基础设施(配置、检查点、管线加载器)
└── tests/ # 合约测试、QA 集成测试、评估框架
三层知识架构
Layer 1: tools/ + pipeline_defs/ "存在什么" —— 可执行能力 + 编排
Layer 2: skills/ "如何使用它" —— OpenMontage 约定和质量标准
Layer 3: .agents/skills/ "它是如何工作的" —— 外部技术知识包
每个工具声明它依赖哪些 Layer 3 技能。Agent 读取 Layer 1 以了解可用内容,读取 Layer 2 以了解 OpenMontage 希望它如何使用,并在需要时读取 Layer 3 以获取深入技术知识。
支持的提供商
视频生成——14 个提供商完整设置指南,含定价和免费层级:
docs/PROVIDERS.md
| 提供商 | 类型 | 说明 |
|---|---|---|
| Kling | 云 API | 高质量、快速 |
| Runway Gen-4 | 云 API | 电影质量、Gen-3 Alpha Turbo / Gen-4 Turbo / Gen-4 Aleph |
| Google Veo 3 | 云 API | 长格式、电影感。通过 fal.ai 或 HeyGen。 |
| Grok Imagine Video | 云 API | 强参考图像视频和 xAI 原生短格式生成 |
| Higgsfield | 云 API | 多模型编排器,具备 Soul ID 以实现角色一致性 |
| MiniMax | 云 API | 经济实惠 |
| HeyGen | 云 API | 多模型网关 |
| WAN 2.1 | 本地 GPU | 免费,1.3B 和 14B 变体 |
| Hunyuan | 本地 GPU | 免费,高质量 |
| CogVideo | 本地 GPU | 免费,2B 和 5B 变体 |
| LTX-Video | 本地 GPU / Modal | 免费本地,或自托管云端 |
| Pexels | 素材库 | 免费素材视频 |
| Pixabay | 素材库 | 免费素材视频 |
| Wikimedia Commons | 素材库 | 免费/开放素材视频和档案视频 |
| 提供商 | 类型 | 说明 |
|---|---|---|
| FLUX | 云 API | 最先进质量 |
| Google Imagen | 云 API | Imagen 4 — 高质量,多种宽高比 |
| Grok Imagine Image | 云 API | 强图像编辑、风格迁移和多图像合成 |
| DALL-E 3 | 云 API | OpenAI 的图像模型 |
| Recraft | 云 API | 面向设计风格的生成 |
| Local Diffusion | 本地 GPU | Stable Diffusion,免费 |
| Pexels | 素材库 | 免费素材图片 |
| Pixabay | 素材库 | 免费素材图片 |
| Unsplash | 素材库 | 免费素材图片 |
| ManimCE | 本地 | 数学动画 |
| 提供商 | 类型 | 说明 |
|---|---|---|
| ElevenLabs | 云 API | 高级语音质量 |
| Google TTS | 云 API | 700+ 种声音,50+ 种语言 — 最适合本地化 |
| OpenAI TTS | 云 API | 快速、经济 |
| Piper | 本地 | 完全免费,离线 |
音乐与音效:
| 提供商 | 类型 | 说明 |
|---|---|---|
| Suno AI | 云 API | 带人声、歌词、任何类型的完整歌曲生成。最长 8 分钟。 |
| ElevenLabs Music | 云 API | AI 音乐生成 |
| ElevenLabs SFX | 云 API | 音效生成 |
后期制作(始终可用,始终免费):
| 工具 | 功能 |
|---|---|
| FFmpeg | 视频合成、编码、字幕烧录、音频混流 |
| Video Stitch | 多片段组装、交叉淡入淡出、画中画、空间布局 |
| Video Trimmer | 精确裁剪和提取 |
| Audio Mixer | 多轨混合、闪避、淡入淡出 |
| Audio Enhance | 降噪、归一化 |
| Color Grade | 基于 LUT 的调色 |
| Subtitle Gen | 从时间戳生成 SRT/VTT |
增强:
| 工具 | 功能 |
|---|---|
| Upscale | Real-ESRGAN 图像/视频放大 |
| Background Remove | rembg / U2Net 背景去除 |
| Face Enhance | 面部质量增强 |
| Face Restore | CodeFormer / GFPGAN 面部恢复 |
分析:
| 工具 | 功能 |
|---|---|
| Transcriber | WhisperX 语音转文字,带逐词时间戳 |
| Scene Detect | 自动场景边界检测 |
| Frame Sampler | 智能帧提取 |
| Video Understand | CLIP/BLIP-2 视觉语言分析 |
虚拟主播与唇形同步:
| 工具 | 功能 |
|---|---|
| Talking Head | SadTalker / MuseTalk 虚拟主播动画 |
| Lip Sync | Wav2Lip 音频驱动唇形同步 |
合成与渲染:
| 引擎 | 类型 | 功能 |
|---|---|---|
| Remotion | 本地(Node.js) | 基于 React 的程序化视频 — 弹簧动画图像场景、统计揭示、章节标题、英雄卡片、TikTok 式逐词字幕、场景过渡(淡入淡出/滑动/擦除/翻转)、Google Fonts、带淡入淡出曲线的音频,以及 TalkingHead 虚拟主播合成。当未配置视频生成提供商时,agent 生成静态图像,Remotion 将其变成完全动画化的视频。 |
| HyperFrames | 本地(Node.js ≥ 22) | HTML/CSS/GSAP 程序化视频 — 动态文字排版、产品宣传片、发布短片、自定义运动图形、注册表块(数据图表、颗粒叠加、着色器过渡)、网站转视频工作流,以及绑定的 SVG 角色动画。通过 npx hyperframes 使用;无需检出 monorepo。 |
| FFmpeg | 本地 | 核心视频组装、编码、字幕烧录、音频混流、调色 |
运行时间在提案时选择(render_runtime)并通过 edit_decisions 锁定。运行时间之间的静默切换是治理违规——参见 skills/core/hyperframes.md。
样式系统
样式手册定义了你的制作视觉语言:
| 手册 | 最适合 |
|---|---|
| 简洁专业 | 企业、教育、SaaS |
| 扁平动态图形 | 社交媒体、TikTok、初创公司 |
| 极简图表 | 技术深入讲解、架构 |
手册控制排版、调色板、运动风格、音频配置和质量规则。Agent 读取手册并将其一致地应用于所有生成的素材。
平台输出配置
针对每个主要平台的内置渲染配置:
| 配置 | 分辨率 | 宽高比 |
|---|---|---|
| YouTube 横屏 | 1920x1080 | 16:9 |
| YouTube 4K | 3840x2160 | 16:9 |
| YouTube Shorts | 1080x1920 | 9:16 |
| Instagram Reels | 1080x1920 | 9:16 |
| Instagram Feed | 1080x1080 | 1:1 |
| TikTok | 1080x1920 | 9:16 |
| 1920x1080 | 16:9 | |
| 电影 | 2560x1080 | 21:9 |
制作治理
OpenMontage 将视频制作视为真正的工程——每个阶段都有质量门、审计追踪和强制执行。
质量门
- 合成前验证 — 如果交付承诺被违反(例如,“运动主导”的视频却有 80% 静态图像)、幻灯片风险评分达到临界值,或缺少渲染器系列,则阻止渲染。在浪费 GPU 时间之前捕获有缺陷