Open-Generative-AI
开源AI图像与视频生成工作室,整合200+模型(Flux、Midjourney、Kling、Sora等),支持文生图/视频、图生视频、口型同步及多步工作流。亮点在于无内容过滤、完全免费、可自托管,桌面版还支持本地推理(sd.cpp与Wan2GP),兼顾隐私与灵活度。Web版开箱即用,适合内容创作者快速生成多模态素材。
README
Open Generative AI — AI 视频平台的开源替代方案
AI 视频平台的免费、开源替代方案。 使用 200 多种最先进模型生成 AI 图像和视频——无内容过滤器、无封闭生态系统、无订阅费用。
社区: 加入 Reddit 与 Discord 进行讨论与支持
🤖 使用 AI 编码智能体自动化媒体生成: Generative-Media-Skills——一个技能库,让 Claude Code、Codex 及其他编码助手能够端到端驱动 200+ 图像/视频模型(提示词 → 生成 → 编辑 → 拼接),直接从终端操作。适合构建自动化媒体流水线,无需触碰 UI。
相关项目
开源、基于节点的流程构建器 -> https://github.com/SamurAIGPT/Vibe-Workflow
开源 AI 剪辑——将任意长篇 YouTube 视频转化为可传播的竖屏短视频 -> https://github.com/SamurAIGPT/AI-Youtube-Shorts-Generator
开源 AI 设计智能体 -> https://github.com/Anil-matcha/Open-AI-Design-Agent
🌐 在线试用——无需安装
托管版: https://dev.muapi.ai/open-generative-ai
直接在浏览器中使用全部四个工作室(图像、视频、唇形同步、电影)——无需 Node.js,无需配置。注册免费账号即可开始生成。托管版始终更新至最新模型。
关注 创作者 获取更新
⬇️ 下载桌面应用
一键安装程序——无需 Node.js 或终端。
| 平台 | 下载 |
|---|---|
| macOS Apple Silicon(M1/M2/M3/M4) | Open Generative AI-1.0.9-arm64.dmg |
| macOS Intel(x64) | Open Generative AI-1.0.9.dmg |
| Windows(x64) | Open Generative AI Setup 1.0.9.exe |
| Linux(Ubuntu x64) | v1.0.9 发布(.AppImage / .deb),或使用 npm run electron:build:linux 本地构建。 |
所有发布版本: github.com/Anil-matcha/Open-Generative-AI/releases
macOS 安装指南
由于该应用未经 Apple 公证,macOS Gatekeeper 会在首次启动时进行拦截。请按以下步骤操作:
步骤 1 — 挂载 DMG 并将应用拖入 /Applications 文件夹
步骤 2 — 打开终端并运行:
xattr -cr "/Applications/Open Generative AI.app"
步骤 3 — 在 /Applications 中右键点击该应用 → 点击 打开 → 在对话框中再次点击 打开
仅需执行一次。之后应用即可正常打开。
替代方法(无需终端):
- 尝试打开应用——macOS 会拦截
- 前往 系统设置 → 隐私与安全性
- 向下滚动找到 “Open Generative AI 已被阻止”
- 点击 仍要打开 → 打开
Windows 安装——SmartScreen 警告解决
Windows SmartScreen 可能因安装程序未进行代码签名而显示警告:
- 在 SmartScreen 对话框中点击 更多信息
- 点击 仍要运行
应用将静默安装到 %LocalAppData% 并创建开始菜单快捷方式。
Ubuntu / Linux 安装
使用 Electron Builder 构建时可获得 Linux 产物:
# 构建 Linux 安装程序(AppImage + .deb)
npm run electron:build:linux
生成的文件写入 release/ 文件夹:
- AppImage — 便携版,可直接运行:
chmod +x "release/Open Generative AI-*.AppImage" ./release/Open\ Generative\ AI-*.AppImage - .deb — 在 Debian/Ubuntu 上安装:
sudo apt install ./release/open-generative-ai_*_amd64.deb
如果 AppImage 在旧系统上无法启动,请安装 libfuse2:
sudo apt install libfuse2
Ubuntu 24.04+ / AppArmor 沙箱限制
Ubuntu 24.04 及更高版本启用了内核安全策略(apparmor_restrict_unprivileged_userns),该策略会阻止 Chromium 的用户命名空间沙箱。如果应用静默失败或立即崩溃,您有两个选择:
选项 A — 推荐:安装 .deb 替代。
.deb 包附带一个 AppArmor 配置文件,可在安装时自动授予所需权限,无需修改系统范围设置。
选项 B — 临时系统修复(AppImage 用户):
sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns=0
该设置持续至下次重启。如需永久生效:
echo 'kernel.apparmor_restrict_unprivileged_userns=0' | sudo tee /etc/sysctl.d/99-userns.conf
Open Generative AI 是一款免费、开源的 AI 图像、视频、电影及唇形同步工作室,将创意工作流程带给所有人。无内容过滤器、无提示拒绝、无护栏——只有完全的创作自由。由 Muapi.ai 提供支持,支持文本到图像、图像到图像、文本到视频、图像到视频以及音频驱动唇形同步生成,涵盖 Flux、Nano Banana、Midjourney、Kling、Sora、Veo、Seedream、Infinite Talk、LTX Lipsync、Wan 2.2 等模型——全部集成于一个可自托管和自定义的现代精致界面中。
为什么选择 Open Generative AI 而非其他 AI 视频平台?
- 无过滤器——无内容过滤器、无保姆式护栏、无提示拒绝
- 免费且开源——无订阅、无供应商锁定
- 可自托管——数据保留在您的机器上,完全创作控制
- 200+ 模型——文本到图像、图像到图像、文本到视频、图像到视频、唇形同步
- 多图像输入——最多可向兼容模型提供 14 张参考图像
- 唇形同步工作室——使用 9 个专用模型为肖像动画化或让嘴唇与音频同步
- 可扩展——添加自己的模型、修改 UI、在其基础上构建
深入了解技术架构及“无限预算”电影工作流程背后的理念,请参阅我们的综合指南与路线图。
⚡ 本地模型推理(仅限桌面应用)
桌面应用支持两个独立的本地引擎。根据您实际运行的机器选择合适的:
| 引擎 | 说明 | 最佳用途 |
|---|---|---|
| sd.cpp(内置) | 来自 stable-diffusion.cpp 的 C++ 引擎,与应用程序运行在同一机器上。Apple Silicon 上使用 Metal GPU,Linux/Windows 上使用 CUDA/Vulkan/ROCm。 | 仅限图像模型。在 Mac M 系列上运行。 |
| Wan2GP(自备服务器) | 连接到用户运行的 Wan2GP 服务器的 HTTP 客户端。服务器在 CUDA/ROCm GPU 上运行 Python + PyTorch;桌面应用仅发送提示并接收结果。 | 视频模型(Wan 2.2、Hunyuan、LTX)及大型图像模型(Flux、Qwen-Image)。服务器需要 NVIDIA/AMD GPU;桌面应用本身可在 Mac 上运行。 |
两个引擎共享同一 UI:打开 设置 → 本地模型 进行配置。
引擎 1 — sd.cpp(内置)
| 模型 | 类型 | 大小 | 说明 |
|---|---|---|---|
| Z-Image Turbo ⚡ | Diffusion Transformer | 2.5 GB + 2.7 GB 辅助文件 | 8 步快速版。对内存要求高。 |
| Z-Image Base ⚡ | Diffusion Transformer | 3.5 GB + 2.7 GB 辅助文件 | 50 步高质量版。对内存要求高。 |
| Dreamshaper 8 | SD 1.5 | 2.1 GB | 20 步通用版。Mac 上测试过的最轻选项。 |
| Realistic Vision v5.1 | SD 1.5 | 2.1 GB | 25 步照片级真实 |
| Anything v5 | SD 1.5 | 2.1 GB | 20 步动漫/插画 |
| SDXL Base 1.0 | SDXL | 6.9 GB | 30 步高分辨率 |
Z-Image 模型 需要两个共享的辅助文件(下载一次,两个模型共用):
- Qwen3-4B 文本编码器 — 2.4 GB
- FLUX VAE — 335 MB
使用方法:
- 在桌面应用中打开 设置 → 本地模型
- 安装 sd.cpp 推理引擎(一键自动下载)
- 下载您选择的模型(以及 Z-Image 所需的辅助文件)
- 在 图像工作室 中,点击模型选择器旁的 ⚡ 本地 开关
- 选择您的本地模型并生成——无需 API 密钥
所有下载均在应用内完成。无需系统级安装。
引擎 2 — Wan2GP(远程 Gradio 服务器)
应用不包含 Python 或 Wan2GP 的模型权重。您需在有 CUDA 或 ROCm GPU 的机器上自行运行 Wan2GP,并将桌面应用指向其 URL。
# 在您的 GPU 机器上
git clone https://github.com/deepbeepmeep/Wan2GP
cd Wan2GP
./install.sh # 或在 Windows 上使用 install.bat
python wgp.py --listen --server-name 0.0.0.0 # 绑定所有网络接口
然后在桌面应用中:设置 → 本地模型 → Wan2GP 服务器,粘贴 URL(例如 http://192.168.1.42:7860),点击 测试,然后 保存。Wan2GP 模型将变为可用——图像模型在 图像工作室,视频模型通过相同的生成 API 访问(图像工作室明确拒绝视频输出;完整的视频工作室连接已列入路线图)。
| 模型 | 类型 | 说明 |
|---|---|---|
| Flux.1 Dev | 图像 | 1024px,28 步 |
| Qwen Image | 图像 | 1024px,30 步 |
| Wan 2.2(T2V / I2V) | 视频 | 消费级 GPU 上较慢 |
| Hunyuan Video | 视频 | 高质量 T2V |
| LTX Video | 视频 | 最快的视频选项 |
为什么需要独立服务器? Wan2GP 的运行时(Sage attention、flash-attn、AWQ/GGUF 内核)仅支持 CUDA——没有 MPS / Apple Silicon 路径。将其视为远程服务器,Mac 用户可保留桌面应用,同时将推理任务卸载到 Linux/Windows GPU 机器、局域网内的游戏 PC 或租用的 RunPod/vast.ai 实例。
本地推理仅在桌面应用中可用。 托管网页版始终使用云端 API。
硬件说明
- sd.cpp 可在 CPU(所有平台)和 Apple Silicon(M1/M2/M3/M4)的 Metal GPU 上运行;Linux/Windows 上支持 CUDA/Vulkan/ROCm。
- macOS 桌面二进制内置 Metal GPU 加速——比纯 CPU 快得多。
- sd.cpp Z-Image 建议:16 GB RAM(7.4 GB 权重 + 2.4 GB 计算缓冲区)。在基础 8 GB M 系列 Mac 上,Z-Image 已知会导致系统卡死——请在此类设备上使用 SD 1.5。
- 对于 M2 上的 SD 1.5:启用 Metal dylib 时预计每步约 1–2 秒。如果每步约 10 秒,则二进制可能已回退至 CPU——请参见下文验证。
验证 SD 1.5 路径(Mac 上最快的健全性测试)
如果您想在不通过 UI 的情况下确认 sd.cpp 已正确安装,可以直接使用 sd-cli。它是应用使用的同一个二进制文件。
# 1. 应用数据布局(首次启动时创建)
APP_DATA="$HOME/Library/Application Support/open-generative-ai/local-ai"
ls "$APP_DATA/bin" # sd-cli, libstable-diffusion.dylib
ls "$APP_DATA/models" # 您下载的模型
# 2. 直接下载一个小型 SD 1.5 模型(Dreamshaper 8,约 2 GB)
curl -L --fail --progress-bar \
-o "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \
"https://huggingface.co/Lykon/DreamShaper/resolve/main/DreamShaper_8_pruned.safetensors"
# 3. 运行单次 512x512 / 12 步推理
DYLD_LIBRARY_PATH="$APP_DATA/bin" "$APP_DATA/bin/sd-cli" \
-m "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \
-p "a serene mountain lake at sunrise, oil painting" \
-o /tmp/sd15-test.png \
--steps 12 -H 512 -W 512 --cfg-scale 7.5 --seed 42 \
--sampling-method euler_a
在 Apple Silicon 上成功运行时,会打印 total params memory size = 1969.78MB (VRAM 1969.78MB, RAM 0.00MB)(Metal 支持)并生成一张清晰的 512×512 PNG。如果 VRAM 为 0.00MB,则 dylib 仅使用 CPU——请检查 otool -L "$APP_DATA/bin/libstable-diffusion.dylib" | grep -i metal,如果缺少 Metal,请从 设置 → 本地模型 重新安装引擎。
✨ 功能特性
- 图像工作室 — 根据文本提示生成图像(50+ 文本到图像模型),或转换现有图像(55+ 图像到图像模型)。根据是否提供参考图像自动切换模型集。支持质量与分辨率控制的模型会显示相应控件。
- 本地推理 — 两个引擎:sd.cpp(内置,在 Mac/Win/Linux 上使用 Metal/CUDA/Vulkan/ROCm)适用于 SD 1.5、SDXL 和 Z-Image;Wan2GP(自备 Gradio 服务器)适用于 Flux、Qwen-Image 及视频模型(Wan 2.2、Hunyuan、LTX)。两者均在设置 → 本地模型中配置。
- 多图像输入 — 最多上传 14 张参考图像用于兼容的编辑模型(Nano Banana 2 Edit、Flux Kontext Dev、GPT-4o Edit 等)。多选选择器带顺序标记、批量上传,以及“使用所选”确认流程。
- 视频工作室 — 根据文本提示生成视频(40+ 文本到视频模型),或动画化起始帧图像(60+ 图像到视频模型)。与图像工作室相同的智能模式切换。
- 唇形同步工作室 — 使用音频为肖像图像添加动画效果,或让已有视频中的嘴唇同步。9 个专用模型,涵盖两种模式:肖像图像 + 音频 → 会说话的视频,以及视频 + 音频 → 唇形同步视频。
- 电影工作室 — 用于照片级真实电影镜头的界面,配备专业相机控制(镜头、焦距、光圈)。
- 工作流工作室 — 以可视化方式构建和运行多步骤 AI 流水线。将图像、视频和音频模型链接为自动化流程。浏览社区模板,使用节点编辑器创建自己的流程,并通过交互式运行环境执行。
- 上传历史 — 参考图像一次上传后本地存储。选择面板允许您跨会话重复使用任何已上传的图像——无需重新上传。
- 智能控件 — 动态宽高比、分辨率/质量、持续时间选择器,适应每个模型的能力(包括具有分辨率或质量选项的 t2i 模型)。
- 生成历史 — 浏览、重新访问和下载所有过往生成结果(持久化存储在浏览器存储中)。
- 图像与视频下载 — 一键下载生成的输出,保持完整分辨率。
- API 密钥管理 — 在浏览器 localStorage 中安全存储 API 密钥(除 Muapi 外不发送至任何服务器)。
- 响应式设计 — 在桌面和移动设备上无缝运行,采用深色毛玻璃 UI。
🖼️ 图像工作室 — 双模式
图像工作室自动在两种模型集之间切换:
| 模式 | 触发条件 | 模型 | 提示 |
|---|---|---|---|
| 文本到图像 | 默认(无图像) | 50+ t2i 模型(Flux、Nano Banana 2、Seedream 5.0、Ideogram、GPT-4o、Midjourney…) | 必需 |
| 图像到图像 | 上传参考图像 | 55+ i2i 模型(Kontext、Nano Banana 2 Edit、Seedream 5.0 Edit、Seededit、Upscaler…) | 可选 |
新增模型
| 模型 | 类型 | 主要特性 |
|---|---|---|
| Nano Banana 2 | 文本到图像 | Google Gemini 3.1 Flash Image · 分辨率 1K/2K/4K · Google 搜索增强 · 宽高比 auto |
| Nano Banana 2 Edit | 图像到图像 | 最多 14 张参考图像 · 分辨率 1K/2K/4K · Google 搜索增强 |
| Seedream 5.0 | 文本到图像 | ByteDance · 质量 basic/high · 8 种宽高比 · 最高 4K |
| Seedream 5.0 Edit | 图像到图像 | ByteDance · 自然语言风格迁移 · 质量 basic/high |
| MiniMax Image 01 | 文本到图像 | MiniMax · 8 种宽高比 · 每次最多 4 张图像 · 1500 字符提示 |
多图像输入
接受多张参考图像的模型会在激活时显示多选选择器:
| 模型 | 最大图像数 |
|---|---|
| Nano Banana 2 Edit | 14 |
| Nano Banana Edit | 10 |
| Flux Kontext Dev I2I | 10 |
| Kling O1 Edit Image | 10 |
| GPT-4o Edit / GPT Image 1.5 Edit | 10 |
| Bytedance Seedream Edit v4 / v4.5 | 10 |
| Vidu Q2 Reference to Image | 7 |
| Flux 2 Flex/Pro Edit | 8 |
| Nano Banana Pro Edit | 8 |
| Flux Kontext Pro/Max I2I | 2 |
| Wan 2.5/2.6 Image Edit | 2–3 |
| Qwen Image Edit Plus / 2511 | 3 |
| GPT-4o Image to Image | 5 |
| Flux 2 Klein 4b/9b Edit | 4 |
当选择多图像模型时,上传触发器切换到多选模式:
- 带顺序编号的复选框 — 图像按照您选择的顺序发送给模型
- 批量上传 — 从文件对话框一次选择多个文件
- 计数徽章显示在触发器上,表示当前激活的图像数量;当还有更多可用位置时,会出现
+徽章 - “使用所选”按钮确认并关闭选择器
🎬 视频工作室 — 双模式
视频工作室遵循相同模式:
| 模式 | 触发条件 | 模型 | 提示 |
|---|---|---|---|
| 文本到视频 | 默认(无图像) | 40+ t2v 模型(Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo、Runway…) | 必需 |
| 图像到视频 | 上传起始帧 | 60+ i2v 模型(Kling I2V、Veo3 I2V、Runway I2V、Wan I2V、Seedance 2.0 I2V、Midjourney I2V…) | 可选 |
新增模型
| 模型 | 类型 | 主要特性 |
|---|---|---|
| Seedance 2.0 | 文本到视频 | ByteDance · 宽高比 16:9 / 9:16 / 4:3 / 3:4 · 时长 5 / 10 / 15s · 质量 basic/high |
| Seedance 2.0 I2V | 图像到视频 | ByteDance · 将图像动画化为视频 · 最多 9 张参考图像 · 宽高比 16:9 / 9:16 / 4:3 / 3:4 · 时长 5 / 10 / 15s · 质量 basic/high |
| Seedance 2.0 Extend | 视频扩展 | ByteDance · 无缝延续任何 Seedance 2.0 生成 · 保留风格、运动和音频 · 可选延续提示 · 时长 5 / 10 / 15s · 质量 basic/high |
| Grok Imagine T2V | 文本到视频 | xAI · 时长 6 / 10 / 15s · 模式:fun / normal / spicy · 宽高比 9:16 / 16:9 / 2:3 / 3:2 / 1:1 |
| Grok Imagine I2V | 图像到视频 | xAI · 时长 6 / 10 / 15s · 模式:fun / normal / spicy · 从静态图像生成电影感运动 |
| MiniMax Hailuo 02 / 2.3 Standard & Pro | 文本到视频 / 图像到视频 | MiniMax · 全高清视频 · 多种宽高比 · 包含快速变体 |
🎙️ 唇形同步工作室
唇形同步工作室使用 9 个模型,通过两种输入模式生成音频驱动的说话视频:
| 模式 | 触发条件 | 描述 |
|---|---|---|
| 肖像图像 | 默认 | 上传肖像图像 + 音频文件 → 动画说话视频 |
| 视频 | 切换到视频模式 | 上传已有视频 + 音频文件 → 唇形同步视频 |
基于图像的模型(肖像图像 + 音频 → 视频)
| 模型 | 端点 | 分辨率 | 提示 |
|---|---|---|---|
| Infinite Talk | infinitetalk-image-to-video |
480p, 720p | 可选 |
| Wan 2.2 Speech to Video | wan2.2-speech-to-video |
480p, 720p | 可选 |
| LTX 2.3 Lipsync | ltx-2.3-lipsync |
480p, 720p, 1080p | 可选 |
| LTX 2 19B Lipsync | ltx-2-19b-lipsync |
480p, 720p, 1080p | 可选 |
基于视频的模型(视频 + 音频 → 唇形同步视频)
| 模型 | 端点 | 分辨率 | 提示 |
|---|---|---|---|
| Sync Lipsync | sync-lipsync |
— | — |
| LatentSync | latentsync-video |
— | — |
| Creatify Lipsync | creatify-lipsync |
— | — |
| Veed Lipsync | veed-lipsync |
— | — |
| Infinite Talk V2V | infinitetalk-video-to-video |
480p, 720p | 可选 |
工作原理:
- 使用开关选择 肖像图像 或 视频 模式
- 使用图像/视频上传按钮上传您的肖像图像(或视频)
- 使用音频上传按钮上传您的音频文件
- 可选:输入提示以引导运动风格
- 选择模型和分辨率(如果支持),然后点击 生成
生成历史单独保存在 lipsync_history 中,待处理的任务会在页面重新加载时自动恢复。
🔀 工作流工作室
工作流工作室让您无需编写代码即可构建和运行多步骤 AI 流水线。
主要功能:
- 模板 — 从预构建的工作流开始(图像链、视频流水线等)
- 我的工作流 — 保存和管理您自己的自定义流水线
- 社区 — 浏览和运行其他用户发布的工作流
- 基于节点的构建器 — 拖放式可视化编辑器,连接模型并在步骤之间路由输出
- 运行环境 — 使用表单 UI 以交互方式运行任何工作流;结果内联渲染
- API 执行 — 每个工作流也可通过 Muapi API 调用
💡 想为您自己的应用添加工作流? 请查看 Vibe Workflow——驱动此功能的开源工作流引擎。可轻松集成到任何项目。
🎥 电影工作室控件
电影工作室提供对虚拟摄像机的精确控制,将您的选择转换为优化的提示修饰词:
| 类别 | 可用选项 |
|---|---|
| 相机 | 模块化 8K 数字、全画幅电影数字、大画幅 70mm 胶片、工作室数字 S35、经典 16mm 胶片、高级大画幅数字 |
| 镜头 | 创意移轴、紧凑变形、极限微距、70 年代电影定焦、经典变形、高级现代定焦、暖色电影定焦、旋焦散景肖像、复古定焦、光晕扩散、临床锐利定焦 |
| 焦距 | 8mm(超广角)、14mm、24mm、35mm(人眼视角)、50mm(肖像)、85mm(紧凑肖像) |
| 光圈 | f/1.4(浅景深)、f/4(均衡)、f/11(深焦) |
📁 上传历史与选择器
您上传的每张图像都会本地保存(URL + 缩略图),这样您永远不需要重复上传同一文件:
- 点击上传按钮打开参考图像选择器
- 之前上传的图像以 3 列网格显示,带缩略图
- 单图像模型 — 点击缩略图即可立即选择并关闭
- 多图像模型 — 切换多个缩略图(显示顺序编号),然后点击 使用所选
- 使用 上传文件 按钮上传新图像(在多图像模式下支持多文件选择)
- 使用 ✕ 按钮从历史中删除单个图像
- 历史记录跨浏览器会话持久化(存储在
localStorage中)
🚀 快速开始
前提条件
设置
大多数用户需要的是桌面应用,而非此开发路径。 如果您只想在机器上运行 Open Generative AI,请下载预构建的安装程序替代——无需 Node.js。以下说明适用于从源码构建的贡献者。
根据您的目标选择入口点:
- 桌面应用(Electron) →
npm run electron:dev - 托管网页版(Next.js) →
npm run dev
# 克隆仓库(包含子模块——工作流和智能体包所需)
git clone --recurse-submodules https://github.com/Anil-matcha/Open-Generative-AI.git
cd Open-Generative-AI
# 如果您已克隆但未使用 --recurse-submodules,请运行以下命令一次:
# git submodule update --init --recursive
# 安装依赖 + 构建工作区包(studio、workflow、agents)。
# 此步骤是必需的——仅 `npm install` 不够;工作区
# 需要在任何开发脚本运行之前构建。
npm run setup
# 然后启动以下之一:
npm run electron:dev # 桌面应用(Electron + Vite)— 推荐
npm run dev # 托管网页版(Next.js)→ http://localhost:3000
首次使用时,系统会提示您输入 Muapi API 密钥(如果您仅计划使用本地模型,可跳过密钥输入)。
故障排除 —
Couldn't find a 'pages' directory:这意味着 Next.js 找不到app/文件夹。请确认您从仓库根目录(包含app/、package.json和next.config.mjs的目录)运行npm run dev,并且您已使用子模块克隆。如果packages/Vibe-Workflow或packages/Open-Poe-AI为空,请重新运行npm run setup。
生产构建
npm run build
npm run start
桌面应用构建
使用 Electron 构建原生桌面应用:
# macOS(DMG — Intel + Apple Silicon)
npm run electron:build
# Windows(NSIS 安装程序 — x64 + ARM64)
npm run electron:build:win
# Linux(AppImage + DEB — x64)
npm run electron:build:linux
# 一个命令构建所有平台
npm run electron:build:all
安装程序输出到 release/ 文件夹。预构建的二进制文件也可在 Releases 页面 上获取。
🏗️ 架构
该应用是一个 Next.js 单体仓库,包含共享的 packages/studio 组件库。
Open-Generative-AI/
├── app/ # Next.js 应用路由
│ ├── layout.js # 根布局(Tailwind、字体)
│ ├── page.js # 重定向至 /studio
│ └── studio/
│ └── page.js # 工作室页面——渲染 StandaloneShell
├── components/
│ ├── StandaloneShell.js # 标签导航 + BYOK(从 localStorage 获取 API 密钥)
│ └── ApiKeyModal.js # API 密钥输入弹窗
├── packages/
│ └── studio/ # 共享 React 组件库
│ └── src/
│ ├── index.js # 导出:ImageStudio、VideoStudio、LipSyncStudio、CinemaStudio、WorkflowStudio
│ ├── models.js # 200+ 模型定义(单一可信源)
│ ├── muapi.js # API 客户端(具名导出,apiKey 作为第一个参数)
│ └── components/
│ ├── ImageStudio.jsx # 双模式 t2i/i2i 工作室
│ ├── VideoStudio.jsx # 双模式 t2v/i2v 工作室
│ ├── LipSyncStudio.jsx # 肖像/视频 + 音频 → 说话视频
│ ├── CinemaStudio.jsx # 专业工作室,带相机控制
│ └── WorkflowStudio.jsx # 多步骤流水线构建器与运行环境
├── next.config.mjs # transpilePackages: ['studio']
├── tailwind.config.js
└── package.json # workspaces: ["packages/studio"]
packages/studio 库也被 muapi.ai 上的托管版本使用——在 packages/studio/src/models.js 中的模型更新会自动应用到自托管应用和托管版本。
🔌 API 集成
应用通过两步模式与 Muapi.ai 通信:
- 提交 —
POST /api/v1/{model-endpoint},包含提示和参数 - 轮询 —
GET /api/v1/predictions/{request_id}/result,直到状态为completed
身份验证使用 x-api-key 头部。在开发过程中,Vite 代理通过将 /api 请求路由到 https://api.muapi.ai 来处理 CORS。
文件上传使用 POST /api/v1/upload_file(multipart/form-data),返回一个托管 URL,该 URL 传递给图像条件模型。对于多图像模型,完整的 images_list 数组会在一次请求中转发给 API。
唇形同步任务使用相同的两步模式:专用的 processLipSync() 方法接受 image_url 或 video_url 以及 audio_url,将其调度到模型的端点,并轮询直到输出视频 URL 可用。
🎨 支持的模型类别
| 类别 | 数量 | 示例 |
|---|---|---|
| 文本到图像 | 50+ | Flux Dev、Nano Banana 2、Seedream 5.0、Ideogram v3、Midjourney v7、GPT-4o、SDXL |
| 图像到图像 | 55+ | Nano Banana 2 Edit(×14)、Flux Kontext Pro、GPT-4o Edit、Seededit v3、Upscaler、Background Remover |
| 文本到视频 | 40+ | Kling v3、Sora 2、Veo 3、Wan 2.6、Seedance 2.0、Seedance 2.0 Extend、Seedance Pro、Hailuo 2.3、Runway Gen-3 |
| 图像到视频 |