开源项目

Open-Generative-AI

开源AI图像与视频生成工作室,整合200+模型(Flux、Midjourney、Kling、Sora等),支持文生图/视频、图生视频、口型同步及多步工作流。亮点在于无内容过滤、完全免费、可自托管,桌面版还支持本地推理(sd.cpp与Wan2GP),兼顾隐私与灵活度。Web版开箱即用,适合内容创作者快速生成多模态素材。

README

Open Generative AI — AI 视频平台的开源替代方案

AI 视频平台的免费、开源替代方案。 使用 200 多种最先进模型生成 AI 图像和视频——无内容过滤器、无封闭生态系统、无订阅费用。

社区: 加入 Reddit 与 Discord 进行讨论与支持

🤖 使用 AI 编码智能体自动化媒体生成: Generative-Media-Skills——一个技能库,让 Claude Code、Codex 及其他编码助手能够端到端驱动 200+ 图像/视频模型(提示词 → 生成 → 编辑 → 拼接),直接从终端操作。适合构建自动化媒体流水线,无需触碰 UI。

相关项目

开源、基于节点的流程构建器 -> https://github.com/SamurAIGPT/Vibe-Workflow

开源 AI 剪辑——将任意长篇 YouTube 视频转化为可传播的竖屏短视频 -> https://github.com/SamurAIGPT/AI-Youtube-Shorts-Generator

开源 AI 设计智能体 -> https://github.com/Anil-matcha/Open-AI-Design-Agent

🌐 在线试用——无需安装

托管版: https://dev.muapi.ai/open-generative-ai

直接在浏览器中使用全部四个工作室(图像、视频、唇形同步、电影)——无需 Node.js,无需配置。注册免费账号即可开始生成。托管版始终更新至最新模型。

关注 创作者 获取更新


⬇️ 下载桌面应用

一键安装程序——无需 Node.js 或终端。

平台 下载
macOS Apple Silicon(M1/M2/M3/M4) Open Generative AI-1.0.9-arm64.dmg
macOS Intel(x64) Open Generative AI-1.0.9.dmg
Windows(x64) Open Generative AI Setup 1.0.9.exe
Linux(Ubuntu x64) v1.0.9 发布(.AppImage / .deb),或使用 npm run electron:build:linux 本地构建。

所有发布版本: github.com/Anil-matcha/Open-Generative-AI/releases

macOS 安装指南

由于该应用未经 Apple 公证,macOS Gatekeeper 会在首次启动时进行拦截。请按以下步骤操作:

步骤 1 — 挂载 DMG 并将应用拖入 /Applications 文件夹

步骤 2 — 打开终端并运行:

xattr -cr "/Applications/Open Generative AI.app"

步骤 3 — 在 /Applications 中右键点击该应用 → 点击 打开 → 在对话框中再次点击 打开

仅需执行一次。之后应用即可正常打开。

替代方法(无需终端):

  1. 尝试打开应用——macOS 会拦截
  2. 前往 系统设置 → 隐私与安全性
  3. 向下滚动找到 “Open Generative AI 已被阻止”
  4. 点击 仍要打开 → 打开

Windows 安装——SmartScreen 警告解决

Windows SmartScreen 可能因安装程序未进行代码签名而显示警告:

  1. 在 SmartScreen 对话框中点击 更多信息
  2. 点击 仍要运行

应用将静默安装到 %LocalAppData% 并创建开始菜单快捷方式。

Ubuntu / Linux 安装

使用 Electron Builder 构建时可获得 Linux 产物:

# 构建 Linux 安装程序(AppImage + .deb)
npm run electron:build:linux

生成的文件写入 release/ 文件夹:

  • AppImage — 便携版,可直接运行:
    chmod +x "release/Open Generative AI-*.AppImage"
    ./release/Open\ Generative\ AI-*.AppImage
    
  • .deb — 在 Debian/Ubuntu 上安装:
    sudo apt install ./release/open-generative-ai_*_amd64.deb
    

如果 AppImage 在旧系统上无法启动,请安装 libfuse2:

sudo apt install libfuse2
Ubuntu 24.04+ / AppArmor 沙箱限制

Ubuntu 24.04 及更高版本启用了内核安全策略(apparmor_restrict_unprivileged_userns),该策略会阻止 Chromium 的用户命名空间沙箱。如果应用静默失败或立即崩溃,您有两个选择:

选项 A — 推荐:安装 .deb 替代。 .deb 包附带一个 AppArmor 配置文件,可在安装时自动授予所需权限,无需修改系统范围设置。

选项 B — 临时系统修复(AppImage 用户):

sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns=0

该设置持续至下次重启。如需永久生效:

echo 'kernel.apparmor_restrict_unprivileged_userns=0' | sudo tee /etc/sysctl.d/99-userns.conf

Open Generative AI 是一款免费、开源的 AI 图像、视频、电影及唇形同步工作室,将创意工作流程带给所有人。无内容过滤器、无提示拒绝、无护栏——只有完全的创作自由。由 Muapi.ai 提供支持,支持文本到图像、图像到图像、文本到视频、图像到视频以及音频驱动唇形同步生成,涵盖 Flux、Nano Banana、Midjourney、Kling、Sora、Veo、Seedream、Infinite Talk、LTX Lipsync、Wan 2.2 等模型——全部集成于一个可自托管和自定义的现代精致界面中。

为什么选择 Open Generative AI 而非其他 AI 视频平台?

  • 无过滤器——无内容过滤器、无保姆式护栏、无提示拒绝
  • 免费且开源——无订阅、无供应商锁定
  • 可自托管——数据保留在您的机器上,完全创作控制
  • 200+ 模型——文本到图像、图像到图像、文本到视频、图像到视频、唇形同步
  • 多图像输入——最多可向兼容模型提供 14 张参考图像
  • 唇形同步工作室——使用 9 个专用模型为肖像动画化或让嘴唇与音频同步
  • 可扩展——添加自己的模型、修改 UI、在其基础上构建

深入了解技术架构及“无限预算”电影工作流程背后的理念,请参阅我们的综合指南与路线图。

⚡ 本地模型推理(仅限桌面应用)

桌面应用支持两个独立的本地引擎。根据您实际运行的机器选择合适的:

引擎 说明 最佳用途
sd.cpp(内置) 来自 stable-diffusion.cpp 的 C++ 引擎,与应用程序运行在同一机器上。Apple Silicon 上使用 Metal GPU,Linux/Windows 上使用 CUDA/Vulkan/ROCm。 仅限图像模型。在 Mac M 系列上运行。
Wan2GP(自备服务器) 连接到用户运行的 Wan2GP 服务器的 HTTP 客户端。服务器在 CUDA/ROCm GPU 上运行 Python + PyTorch;桌面应用仅发送提示并接收结果。 视频模型(Wan 2.2、Hunyuan、LTX)及大型图像模型(Flux、Qwen-Image)。服务器需要 NVIDIA/AMD GPU;桌面应用本身可在 Mac 上运行。

两个引擎共享同一 UI:打开 设置 → 本地模型 进行配置。

引擎 1 — sd.cpp(内置)

模型 类型 大小 说明
Z-Image Turbo ⚡ Diffusion Transformer 2.5 GB + 2.7 GB 辅助文件 8 步快速版。对内存要求高。
Z-Image Base ⚡ Diffusion Transformer 3.5 GB + 2.7 GB 辅助文件 50 步高质量版。对内存要求高。
Dreamshaper 8 SD 1.5 2.1 GB 20 步通用版。Mac 上测试过的最轻选项。
Realistic Vision v5.1 SD 1.5 2.1 GB 25 步照片级真实
Anything v5 SD 1.5 2.1 GB 20 步动漫/插画
SDXL Base 1.0 SDXL 6.9 GB 30 步高分辨率

Z-Image 模型 需要两个共享的辅助文件(下载一次,两个模型共用):

  • Qwen3-4B 文本编码器 — 2.4 GB
  • FLUX VAE — 335 MB

使用方法:

  1. 在桌面应用中打开 设置 → 本地模型
  2. 安装 sd.cpp 推理引擎(一键自动下载)
  3. 下载您选择的模型(以及 Z-Image 所需的辅助文件)
  4. 在 图像工作室 中,点击模型选择器旁的 ⚡ 本地 开关
  5. 选择您的本地模型并生成——无需 API 密钥

所有下载均在应用内完成。无需系统级安装。

引擎 2 — Wan2GP(远程 Gradio 服务器)

应用不包含 Python 或 Wan2GP 的模型权重。您需在有 CUDA 或 ROCm GPU 的机器上自行运行 Wan2GP,并将桌面应用指向其 URL。

# 在您的 GPU 机器上
git clone https://github.com/deepbeepmeep/Wan2GP
cd Wan2GP
./install.sh                          # 或在 Windows 上使用 install.bat
python wgp.py --listen --server-name 0.0.0.0   # 绑定所有网络接口

然后在桌面应用中:设置 → 本地模型 → Wan2GP 服务器,粘贴 URL(例如 http://192.168.1.42:7860),点击 测试,然后 保存。Wan2GP 模型将变为可用——图像模型在 图像工作室,视频模型通过相同的生成 API 访问(图像工作室明确拒绝视频输出;完整的视频工作室连接已列入路线图)。

模型 类型 说明
Flux.1 Dev 图像 1024px,28 步
Qwen Image 图像 1024px,30 步
Wan 2.2(T2V / I2V) 视频 消费级 GPU 上较慢
Hunyuan Video 视频 高质量 T2V
LTX Video 视频 最快的视频选项

为什么需要独立服务器? Wan2GP 的运行时(Sage attention、flash-attn、AWQ/GGUF 内核)仅支持 CUDA——没有 MPS / Apple Silicon 路径。将其视为远程服务器,Mac 用户可保留桌面应用,同时将推理任务卸载到 Linux/Windows GPU 机器、局域网内的游戏 PC 或租用的 RunPod/vast.ai 实例。

本地推理仅在桌面应用中可用。 托管网页版始终使用云端 API。

硬件说明

  • sd.cpp 可在 CPU(所有平台)和 Apple Silicon(M1/M2/M3/M4)的 Metal GPU 上运行;Linux/Windows 上支持 CUDA/Vulkan/ROCm。
  • macOS 桌面二进制内置 Metal GPU 加速——比纯 CPU 快得多。
  • sd.cpp Z-Image 建议:16 GB RAM(7.4 GB 权重 + 2.4 GB 计算缓冲区)。在基础 8 GB M 系列 Mac 上,Z-Image 已知会导致系统卡死——请在此类设备上使用 SD 1.5。
  • 对于 M2 上的 SD 1.5:启用 Metal dylib 时预计每步约 1–2 秒。如果每步约 10 秒,则二进制可能已回退至 CPU——请参见下文验证。

验证 SD 1.5 路径(Mac 上最快的健全性测试)

如果您想在不通过 UI 的情况下确认 sd.cpp 已正确安装,可以直接使用 sd-cli。它是应用使用的同一个二进制文件。

# 1. 应用数据布局(首次启动时创建)
APP_DATA="$HOME/Library/Application Support/open-generative-ai/local-ai"
ls "$APP_DATA/bin"     # sd-cli, libstable-diffusion.dylib
ls "$APP_DATA/models"  # 您下载的模型

# 2. 直接下载一个小型 SD 1.5 模型(Dreamshaper 8,约 2 GB)
curl -L --fail --progress-bar \
  -o "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \
  "https://huggingface.co/Lykon/DreamShaper/resolve/main/DreamShaper_8_pruned.safetensors"

# 3. 运行单次 512x512 / 12 步推理
DYLD_LIBRARY_PATH="$APP_DATA/bin" "$APP_DATA/bin/sd-cli" \
  -m "$APP_DATA/models/DreamShaper_8_pruned.safetensors" \
  -p "a serene mountain lake at sunrise, oil painting" \
  -o /tmp/sd15-test.png \
  --steps 12 -H 512 -W 512 --cfg-scale 7.5 --seed 42 \
  --sampling-method euler_a

在 Apple Silicon 上成功运行时,会打印 total params memory size = 1969.78MB (VRAM 1969.78MB, RAM 0.00MB)(Metal 支持)并生成一张清晰的 512×512 PNG。如果 VRAM 为 0.00MB,则 dylib 仅使用 CPU——请检查 otool -L "$APP_DATA/bin/libstable-diffusion.dylib" | grep -i metal,如果缺少 Metal,请从 设置 → 本地模型 重新安装引擎。


✨ 功能特性

  • 图像工作室 — 根据文本提示生成图像(50+ 文本到图像模型),或转换现有图像(55+ 图像到图像模型)。根据是否提供参考图像自动切换模型集。支持质量与分辨率控制的模型会显示相应控件。
  • 本地推理 — 两个引擎:sd.cpp(内置,在 Mac/Win/Linux 上使用 Metal/CUDA/Vulkan/ROCm)适用于 SD 1.5、SDXL 和 Z-Image;Wan2GP(自备 Gradio 服务器)适用于 Flux、Qwen-Image 及视频模型(Wan 2.2、Hunyuan、LTX)。两者均在设置 → 本地模型中配置。
  • 多图像输入 — 最多上传 14 张参考图像用于兼容的编辑模型(Nano Banana 2 Edit、Flux Kontext Dev、GPT-4o Edit 等)。多选选择器带顺序标记、批量上传,以及“使用所选”确认流程。
  • 视频工作室 — 根据文本提示生成视频(40+ 文本到视频模型),或动画化起始帧图像(60+ 图像到视频模型)。与图像工作室相同的智能模式切换。
  • 唇形同步工作室 — 使用音频为肖像图像添加动画效果,或让已有视频中的嘴唇同步。9 个专用模型,涵盖两种模式:肖像图像 + 音频 → 会说话的视频,以及视频 + 音频 → 唇形同步视频。
  • 电影工作室 — 用于照片级真实电影镜头的界面,配备专业相机控制(镜头、焦距、光圈)。
  • 工作流工作室 — 以可视化方式构建和运行多步骤 AI 流水线。将图像、视频和音频模型链接为自动化流程。浏览社区模板,使用节点编辑器创建自己的流程,并通过交互式运行环境执行。
  • 上传历史 — 参考图像一次上传后本地存储。选择面板允许您跨会话重复使用任何已上传的图像——无需重新上传。
  • 智能控件 — 动态宽高比、分辨率/质量、持续时间选择器,适应每个模型的能力(包括具有分辨率或质量选项的 t2i 模型)。
  • 生成历史 — 浏览、重新访问和下载所有过往生成结果(持久化存储在浏览器存储中)。
  • 图像与视频下载 — 一键下载生成的输出,保持完整分辨率。
  • API 密钥管理 — 在浏览器 localStorage 中安全存储 API 密钥(除 Muapi 外不发送至任何服务器)。
  • 响应式设计 — 在桌面和移动设备上无缝运行,采用深色毛玻璃 UI。

🖼️ 图像工作室 — 双模式

图像工作室自动在两种模型集之间切换:

模式 触发条件 模型 提示
文本到图像 默认(无图像) 50+ t2i 模型(Flux、Nano Banana 2、Seedream 5.0、Ideogram、GPT-4o、Midjourney…) 必需
图像到图像 上传参考图像 55+ i2i 模型(Kontext、Nano Banana 2 Edit、Seedream 5.0 Edit、Seededit、Upscaler…) 可选
新增模型
模型 类型 主要特性
Nano Banana 2 文本到图像 Google Gemini 3.1 Flash Image · 分辨率 1K/2K/4K · Google 搜索增强 · 宽高比 auto
Nano Banana 2 Edit 图像到图像 最多 14 张参考图像 · 分辨率 1K/2K/4K · Google 搜索增强
Seedream 5.0 文本到图像 ByteDance · 质量 basic/high · 8 种宽高比 · 最高 4K
Seedream 5.0 Edit 图像到图像 ByteDance · 自然语言风格迁移 · 质量 basic/high
MiniMax Image 01 文本到图像 MiniMax · 8 种宽高比 · 每次最多 4 张图像 · 1500 字符提示
多图像输入

接受多张参考图像的模型会在激活时显示多选选择器:

模型 最大图像数
Nano Banana 2 Edit 14
Nano Banana Edit 10
Flux Kontext Dev I2I 10
Kling O1 Edit Image 10
GPT-4o Edit / GPT Image 1.5 Edit 10
Bytedance Seedream Edit v4 / v4.5 10
Vidu Q2 Reference to Image 7
Flux 2 Flex/Pro Edit 8
Nano Banana Pro Edit 8
Flux Kontext Pro/Max I2I 2
Wan 2.5/2.6 Image Edit 2–3
Qwen Image Edit Plus / 2511 3
GPT-4o Image to Image 5
Flux 2 Klein 4b/9b Edit 4

当选择多图像模型时,上传触发器切换到多选模式:

  • 带顺序编号的复选框 — 图像按照您选择的顺序发送给模型
  • 批量上传 — 从文件对话框一次选择多个文件
  • 计数徽章显示在触发器上,表示当前激活的图像数量;当还有更多可用位置时,会出现 + 徽章
  • “使用所选”按钮确认并关闭选择器

🎬 视频工作室 — 双模式

视频工作室遵循相同模式:

模式 触发条件 模型 提示
文本到视频 默认(无图像) 40+ t2v 模型(Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo、Runway…) 必需
图像到视频 上传起始帧 60+ i2v 模型(Kling I2V、Veo3 I2V、Runway I2V、Wan I2V、Seedance 2.0 I2V、Midjourney I2V…) 可选
新增模型
模型 类型 主要特性
Seedance 2.0 文本到视频 ByteDance · 宽高比 16:9 / 9:16 / 4:3 / 3:4 · 时长 5 / 10 / 15s · 质量 basic/high
Seedance 2.0 I2V 图像到视频 ByteDance · 将图像动画化为视频 · 最多 9 张参考图像 · 宽高比 16:9 / 9:16 / 4:3 / 3:4 · 时长 5 / 10 / 15s · 质量 basic/high
Seedance 2.0 Extend 视频扩展 ByteDance · 无缝延续任何 Seedance 2.0 生成 · 保留风格、运动和音频 · 可选延续提示 · 时长 5 / 10 / 15s · 质量 basic/high
Grok Imagine T2V 文本到视频 xAI · 时长 6 / 10 / 15s · 模式:fun / normal / spicy · 宽高比 9:16 / 16:9 / 2:3 / 3:2 / 1:1
Grok Imagine I2V 图像到视频 xAI · 时长 6 / 10 / 15s · 模式:fun / normal / spicy · 从静态图像生成电影感运动
MiniMax Hailuo 02 / 2.3 Standard & Pro 文本到视频 / 图像到视频 MiniMax · 全高清视频 · 多种宽高比 · 包含快速变体

🎙️ 唇形同步工作室

唇形同步工作室使用 9 个模型,通过两种输入模式生成音频驱动的说话视频:

模式 触发条件 描述
肖像图像 默认 上传肖像图像 + 音频文件 → 动画说话视频
视频 切换到视频模式 上传已有视频 + 音频文件 → 唇形同步视频
基于图像的模型(肖像图像 + 音频 → 视频)
模型 端点 分辨率 提示
Infinite Talk infinitetalk-image-to-video 480p, 720p 可选
Wan 2.2 Speech to Video wan2.2-speech-to-video 480p, 720p 可选
LTX 2.3 Lipsync ltx-2.3-lipsync 480p, 720p, 1080p 可选
LTX 2 19B Lipsync ltx-2-19b-lipsync 480p, 720p, 1080p 可选
基于视频的模型(视频 + 音频 → 唇形同步视频)
模型 端点 分辨率 提示
Sync Lipsync sync-lipsync — —
LatentSync latentsync-video — —
Creatify Lipsync creatify-lipsync — —
Veed Lipsync veed-lipsync — —
Infinite Talk V2V infinitetalk-video-to-video 480p, 720p 可选

工作原理:

  1. 使用开关选择 肖像图像 或 视频 模式
  2. 使用图像/视频上传按钮上传您的肖像图像(或视频)
  3. 使用音频上传按钮上传您的音频文件
  4. 可选:输入提示以引导运动风格
  5. 选择模型和分辨率(如果支持),然后点击 生成

生成历史单独保存在 lipsync_history 中,待处理的任务会在页面重新加载时自动恢复。

🔀 工作流工作室

工作流工作室让您无需编写代码即可构建和运行多步骤 AI 流水线。

主要功能:

  • 模板 — 从预构建的工作流开始(图像链、视频流水线等)
  • 我的工作流 — 保存和管理您自己的自定义流水线
  • 社区 — 浏览和运行其他用户发布的工作流
  • 基于节点的构建器 — 拖放式可视化编辑器,连接模型并在步骤之间路由输出
  • 运行环境 — 使用表单 UI 以交互方式运行任何工作流;结果内联渲染
  • API 执行 — 每个工作流也可通过 Muapi API 调用

💡 想为您自己的应用添加工作流? 请查看 Vibe Workflow——驱动此功能的开源工作流引擎。可轻松集成到任何项目。

🎥 电影工作室控件

电影工作室提供对虚拟摄像机的精确控制,将您的选择转换为优化的提示修饰词:

类别 可用选项
相机 模块化 8K 数字、全画幅电影数字、大画幅 70mm 胶片、工作室数字 S35、经典 16mm 胶片、高级大画幅数字
镜头 创意移轴、紧凑变形、极限微距、70 年代电影定焦、经典变形、高级现代定焦、暖色电影定焦、旋焦散景肖像、复古定焦、光晕扩散、临床锐利定焦
焦距 8mm(超广角)、14mm、24mm、35mm(人眼视角)、50mm(肖像)、85mm(紧凑肖像)
光圈 f/1.4(浅景深)、f/4(均衡)、f/11(深焦)

📁 上传历史与选择器

您上传的每张图像都会本地保存(URL + 缩略图),这样您永远不需要重复上传同一文件:

  • 点击上传按钮打开参考图像选择器
  • 之前上传的图像以 3 列网格显示,带缩略图
  • 单图像模型 — 点击缩略图即可立即选择并关闭
  • 多图像模型 — 切换多个缩略图(显示顺序编号),然后点击 使用所选
  • 使用 上传文件 按钮上传新图像(在多图像模式下支持多文件选择)
  • 使用 ✕ 按钮从历史中删除单个图像
  • 历史记录跨浏览器会话持久化(存储在 localStorage 中)

🚀 快速开始

前提条件

设置

大多数用户需要的是桌面应用,而非此开发路径。 如果您只想在机器上运行 Open Generative AI,请下载预构建的安装程序替代——无需 Node.js。以下说明适用于从源码构建的贡献者。

根据您的目标选择入口点:

  • 桌面应用(Electron) → npm run electron:dev
  • 托管网页版(Next.js) → npm run dev
# 克隆仓库(包含子模块——工作流和智能体包所需)
git clone --recurse-submodules https://github.com/Anil-matcha/Open-Generative-AI.git
cd Open-Generative-AI

# 如果您已克隆但未使用 --recurse-submodules,请运行以下命令一次:
# git submodule update --init --recursive

# 安装依赖 + 构建工作区包(studio、workflow、agents)。
# 此步骤是必需的——仅 `npm install` 不够;工作区
# 需要在任何开发脚本运行之前构建。
npm run setup

# 然后启动以下之一:
npm run electron:dev   # 桌面应用(Electron + Vite)— 推荐
npm run dev            # 托管网页版(Next.js)→ http://localhost:3000

首次使用时,系统会提示您输入 Muapi API 密钥(如果您仅计划使用本地模型,可跳过密钥输入)。

故障排除 — Couldn't find a 'pages' directory:这意味着 Next.js 找不到 app/ 文件夹。请确认您从仓库根目录(包含 app/、package.json 和 next.config.mjs 的目录)运行 npm run dev,并且您已使用子模块克隆。如果 packages/Vibe-Workflow 或 packages/Open-Poe-AI 为空,请重新运行 npm run setup。

生产构建

npm run build
npm run start

桌面应用构建

使用 Electron 构建原生桌面应用:

# macOS(DMG — Intel + Apple Silicon)
npm run electron:build

# Windows(NSIS 安装程序 — x64 + ARM64)
npm run electron:build:win

# Linux(AppImage + DEB — x64)
npm run electron:build:linux

# 一个命令构建所有平台
npm run electron:build:all

安装程序输出到 release/ 文件夹。预构建的二进制文件也可在 Releases 页面 上获取。

🏗️ 架构

该应用是一个 Next.js 单体仓库,包含共享的 packages/studio 组件库。

Open-Generative-AI/
├── app/                        # Next.js 应用路由
│   ├── layout.js               # 根布局(Tailwind、字体)
│   ├── page.js                 # 重定向至 /studio
│   └── studio/
│       └── page.js             # 工作室页面——渲染 StandaloneShell
├── components/
│   ├── StandaloneShell.js      # 标签导航 + BYOK(从 localStorage 获取 API 密钥)
│   └── ApiKeyModal.js          # API 密钥输入弹窗
├── packages/
│   └── studio/                 # 共享 React 组件库
│       └── src/
│           ├── index.js        # 导出:ImageStudio、VideoStudio、LipSyncStudio、CinemaStudio、WorkflowStudio
│           ├── models.js       # 200+ 模型定义(单一可信源)
│           ├── muapi.js        # API 客户端(具名导出,apiKey 作为第一个参数)
│           └── components/
│               ├── ImageStudio.jsx    # 双模式 t2i/i2i 工作室
│               ├── VideoStudio.jsx    # 双模式 t2v/i2v 工作室
│               ├── LipSyncStudio.jsx  # 肖像/视频 + 音频 → 说话视频
│               ├── CinemaStudio.jsx   # 专业工作室,带相机控制
│               └── WorkflowStudio.jsx # 多步骤流水线构建器与运行环境
├── next.config.mjs             # transpilePackages: ['studio']
├── tailwind.config.js
└── package.json                # workspaces: ["packages/studio"]

packages/studio 库也被 muapi.ai 上的托管版本使用——在 packages/studio/src/models.js 中的模型更新会自动应用到自托管应用和托管版本。

🔌 API 集成

应用通过两步模式与 Muapi.ai 通信:

  1. 提交 — POST /api/v1/{model-endpoint},包含提示和参数
  2. 轮询 — GET /api/v1/predictions/{request_id}/result,直到状态为 completed

身份验证使用 x-api-key 头部。在开发过程中,Vite 代理通过将 /api 请求路由到 https://api.muapi.ai 来处理 CORS。

文件上传使用 POST /api/v1/upload_file(multipart/form-data),返回一个托管 URL,该 URL 传递给图像条件模型。对于多图像模型,完整的 images_list 数组会在一次请求中转发给 API。

唇形同步任务使用相同的两步模式:专用的 processLipSync() 方法接受 image_url 或 video_url 以及 audio_url,将其调度到模型的端点,并轮询直到输出视频 URL 可用。

🎨 支持的模型类别

类别 数量 示例
文本到图像 50+ Flux Dev、Nano Banana 2、Seedream 5.0、Ideogram v3、Midjourney v7、GPT-4o、SDXL
图像到图像 55+ Nano Banana 2 Edit(×14)、Flux Kontext Pro、GPT-4o Edit、Seededit v3、Upscaler、Background Remover
文本到视频 40+ Kling v3、Sora 2、Veo 3、Wan 2.6、Seedance 2.0、Seedance 2.0 Extend、Seedance Pro、Hailuo 2.3、Runway Gen-3
图像到视频
开源项目Anil-matcha2026-05-16原文

相关内容