KugelAudio
KugelAudio 是一款实时文本转语音模型,支持语音克隆和低延迟,适合开发者和企业自托管或 API 调用。
Maker 说
嗨 PH 👋 我是 KugelAudio 的 Kajo。我们四个人在柏林,现在在旧金山做 YC。我们在为未来构建产品,我们相信未来是对话式的。
今天我们发布了一款支持声音克隆的实时 TTS 模型。如果你只有一分钟时间,以下是你需要知道的。
你可以从 30 到 60 秒的音频中克隆声音。放一段短样本,就能立刻得到一个可用的声音。
我们针对语音智能体做了优化,延迟低于 60 毫秒(不含网络延迟),支持输入流和输出流。
我们提供本地部署支持,你可以在自己的集群里运行模型,而不用调用我们的 API。当数据需要留在你网络内时,这个方案很有用。
适配 LiveKit、Pipecat 和 Vapi。提供 Python、JS 和 Java 的 SDK。有免费套餐,你不需要先联系我们就能试用。
我们的创始工程师 Alex 今天会在帖子里回答硬核问题:模型架构、延迟的来源、这个版本之前我们搞坏了什么才让它正常工作。随便问!
恭喜你们发布!
1. 网站上列出了支持的语言比如印地语,但在 playground 上找不到对应的语音。
2. 我看了 TTS 的 WebSocket streaming API... streaming API 能像 ElevenLabs 那样支持多上下文吗?未来有计划吗?
干杯!