开源项目

voice-pro

voice-pro

集成语音识别、翻译、TTS 与零样本语音克隆的 Gradio WebUI,支持 YouTube 下载、Demucs 人声分离和 100+ 语言字幕生成。对标 ElevenLabs,把 Whisper、F5-TTS、CosyVoice、Edge-TTS 等模型打包成开箱即用的桌面应用,安装脚本自动处理依赖,适合创作者快速制作多语言配音和克隆音色。

README

Voice-Pro

最佳 AI 语音识别、翻译和多语言配音解决方案 🚀

Ask DeepWiki.com youtube Buy Me a Coffee release GitHub Repo stars

Dubbing Studio


🎙️ 一款 AI 驱动的语音识别、翻译和配音网络应用

South Korea Flag 한국어 ∙ United Kingdom Flag English ∙ China Flag 中文简体 ∙ Taiwan Flag 中文繁體 ∙ Japan Flag 日本語 ∙ Germany Flag Deutsch ∙ Spain Flag Español ∙ Portugal Flag Português

Voice-Pro 是一款最先进的网络应用,彻底改变了多媒体内容的创作方式。它将 YouTube 视频下载、人声分离、语音识别、翻译和文本转语音集成到一个功能强大的工具中,面向创作者、研究人员和多语言专业人士。

  • 🔊 顶级语音识别:Whisper、Faster-Whisper、Whisper-Timestamped
  • 🎤 零样本声音克隆:F5-TTS、E2-TTS、CosyVoice(包括 Fun-CosyVoice3 —— 支持韩语及其他 8 种语言)
  • 📢 多语言文本转语音:Edge-TTS、kokoro(可选 Azure TTS,使用您自己的密钥 —— 参见 Azure 服务)
  • 🎥 YouTube 处理与音频提取:yt-dlp
  • 🌍 100+ 语言即时翻译:Deep-Translator(可选 Azure Translator,使用您自己的密钥)

作为 ElevenLabs 的强力替代方案,Voice-Pro 为播客主、开发者和创作者提供先进的语音解决方案。

⚠️ 请注意

  • 由于 WeConnect 开发工作,Voice-Pro 的开发与更新暂时无法进行。
  • 我们已将 Voice-Pro 的全部代码开源并完全免费。现在任何人都可以自由分发和修改 Voice-Pro。
  • 在配备 NVIDIA GPU 的 Windows 上运行良好。Mac 和 Linux 上的运行尚未验证。
  • 请将您的需求发布到 GitHub Issues 或 GitHub Discussions 页面。
  • 故障排除:大多数情况下,删除 installer_files 文件夹后重新运行 start.bat 即可解决问题(全新安装只需几分钟;model/ 中已下载的 AI 模型会保留)。错误会以红色提示条的形式显示在 WebUI 中,并一直保留直到您手动关闭。

📰 新闻与更新历史

版本 4.0
  • ⚡ 安装器从 Miniconda/pip 迁移到 uv — 安装速度大幅提升,通过提交的 uv.lock 实现完全可复现的安装。所有内容均保留在 installer_files/ 内(uv、Python、包)。
  • 🐍 运行时升级:Python 3.12、Torch 2.8.0+cu128(支持 RTX 50 系列)、Gradio 6.20。
  • 🎙️ 最新 ASR 技术栈:faster-whisper 1.2.1(large-v3-turbo、distil-large-v3.5)、openai-whisper 20250625、whisper-timestamped 1.15.9。whisperX 已移除(其依赖锁定阻碍了 Gradio 6 升级;现有配置将回退到 faster-whisper)。
  • 🗣️ 最新 TTS 技术栈:F5-TTS 1.1.21、kokoro 0.9.4、edge-tts 7.x,以及重新 vendored 的 CosyVoice(上游 main 分支)。
  • 🇰🇷 新增可选 TTS 模型:Fun-CosyVoice3-0.5B — 支持包括韩语在内的 9 种语言,可在 CosyVoice 标签页中选择(首次使用时从官方 HF 仓库下载)。
  • 🧹 不再需要安装 CUDA Toolkit 和 Visual Studio Build Tools — 所有依赖均提供预编译 wheel,PyTorch 自带 CUDA 运行时。
  • 🛡️ 对受限环境 / 企业电脑友好:无需管理员权限 — start.bat 会在系统未安装 ffmpeg 时自动下载便携版 ffmpeg;Whisper 模型下载在中断/损坏后会自动修复;当网络对免费 Google 端点限流时,翻译会自动以退避策略重试(失败行会报告,保留原文)。
  • 🚨 错误现在会在 WebUI 中显示:每次失败都会显示红色错误提示,并一直保留到您关闭(以前是容易忽略的 10 秒警告),同时提供针对常见原因的可行提示(缺少 ffmpeg、未注册媒体等)。
  • 🖥️ UI:迁移到 Gradio 6(所有标签页均采用全宽布局,字幕轨直接显示在视频播放器中)。
  • 🧽 uninstall.bat 不再需要管理员权限,也不再强制重启系统;uninstall.bat silent 可无人值守运行。
版本 3.2
  • 过去几个月我们一直专注于 WeConnect 的开发,完全无暇管理 Voice-Pro。
  • 我们决定将 Voice-Pro 的全部代码开源。
  • Voice-Pro 完全免费,支持 Windows、Mac、Linux。
  • WeConnect 是一款面向全球文化交流的应用。
  • 与来自世界各地的人们建立联系,进行有意义的文化交流、语言学习和国际友谊。

ScreenShot 0 ScreenShot 1 ScreenShot 2 ScreenShot 3 ScreenShot 4

版本 3.1 版本 3.0
  • 🔥 移除了 AI Cover 功能。
  • 🚀 增加了对 m-bain/whisperX 的支持。
版本 2.0
  • 🐍 基于 Python 3.10.15、Torch 2.5.1+cu124 和 Gradio 5.14.0 构建。
  • 🆓 免费试用支持最长 60 秒 的媒体文件。
  • 🔥 新增 AI Cover 功能。
  • 🎤 引入对 CosyVoice 和 kokoro 的支持。
  • ⏳ 首次运行需要下载 CozyVoice2-0.5B(9GB),根据网络速度可能需要一个小时以上。
  • 🎧 用于克隆的语音样本将持续更新。
  • 📝 新增 spaCy,用于自然的逐句翻译和 TTS。
  • ☁️ 订阅版包含 Microsoft Azure 翻译器和 TTS。
  • 🏪 订阅期间提供 无限使用(无 60 秒限制),可通过 Shopify 获取。

🎥 YouTube 视频展示

Demo Video 1
Voice-Pro 演示(v2.0)
Demo Video 2
F5-TTS: 声音克隆
Demo Video 3
实时转录与翻译
Demo Video 4
多语言声音克隆:韩语 - 德语
Demo Video 5
多语言声音克隆:英语 - 韩语
Demo Video 6
多语言声音克隆:韩语 - 日语
Demo Video 7
NVIDIA RTX 视频超分辨率
Demo Video 8
AI 卡拉OK
Demo Video 5
多语言声音克隆:英语 - 韩语

⭐ 核心功能

1. 配音工作室

  • YouTube 视频下载与音频提取
  • 使用 Demucs 进行人声分离
  • 支持 100+ 种语言的语音识别与翻译

2. 语音技术

  • 语音转文本: Whisper、Faster-Whisper、Whisper-Timestamped
  • 文本转语音:
    • Edge-TTS:100+ 种语言,400+ 个声音
    • E2-TTS、F5-TTS、CosyVoice:零样本克隆
    • kokoro:在 HuggingFace TTS Arena 中排名第 2

3. 实时翻译

  • 即时语音识别
  • 实时多语言翻译
  • 可自定义音频输入

🤖 WebUI

配音工作室 标签页

  • 一体化中心:YouTube 下载、噪音消除、字幕、翻译和 TTS
  • 支持所有 ffmpeg 兼容格式
  • 输出选项:WAV、FLAC、MP3
  • 100+ 种语言的字幕和识别
  • TTS 支持速度、音量和音调控制

Multilingual Voice Conversion and Subtitle Generation Web UI Interface

Whisper 字幕 标签页

  • 专注字幕:90+ 种语言
  • 视频内嵌字幕显示
  • 单词级高亮和降噪选项

翻译 标签页

  • 100+ 种语言的翻译
  • 支持字幕文件(ASS、SSA、SRT 等)
  • 实时语音识别与翻译

WebUI for Real-Time Speech Recognition and Translation

语音生成 标签页

  • 选项:Edge-TTS、F5-TTS、CosyVoice、kokoro
  • 名人语音播客和多语言支持

Podcast Production WebUI Using Voice-Cloning Technology

🎤✨ 参考声音

  • 请在 Issues 页面申请您想要添加的声音。Issues
英语
<td align="center
开源项目abus-aikorea2026-08-01原文

相关内容


Andrew Bustamante

Andrew Huberman

Avi Loeb

Ben Shapiro

Brett Johnson

Brian Keating

Coffeezilla

Dan Carlin

David Buss

David Fravor

David Kipping

Dennis Whyte

Donald Hoffman

Donald Trump

Douglas Murray

Duncan Trussell

Elon Musk

Garry Nolan

Jack Barsky

James Sexton

Jeff Bezos

Joe Rogan

John Mearsheimer

Jordan Peterson

Kanye 'Ye' West

Mark Zuckerberg

Michael Levin

Michael Saylor

Michio Kaku

MrBeast

Nick Lane

Paul Rosolie

Ryan Graves

Sam Altman

Sam Harris