热门产品

KugelAudio

KugelAudio

KugelAudio 是一款实时文本转语音模型,支持语音克隆和低延迟,适合开发者和企业自托管或 API 调用。

Maker 说

嗨 PH 👋 我是 KugelAudio 的 Kajo。我们四个人在柏林,现在在旧金山做 YC。我们在为未来构建产品,我们相信未来是对话式的。

今天我们发布了一款支持声音克隆的实时 TTS 模型。如果你只有一分钟时间,以下是你需要知道的。

你可以从 30 到 60 秒的音频中克隆声音。放一段短样本,就能立刻得到一个可用的声音。

我们针对语音智能体做了优化,延迟低于 60 毫秒(不含网络延迟),支持输入流和输出流。

我们提供本地部署支持,你可以在自己的集群里运行模型,而不用调用我们的 API。当数据需要留在你网络内时,这个方案很有用。

适配 LiveKit、Pipecat 和 Vapi。提供 Python、JS 和 Java 的 SDK。有免费套餐,你不需要先联系我们就能试用。

我们的创始工程师 Alex 今天会在帖子里回答硬核问题:模型架构、延迟的来源、这个版本之前我们搞坏了什么才让它正常工作。随便问!

热门评论

PH 用户
Sensational 用于德语 TTS

恭喜你们发布!
PH 用户
它在混合语言环境(比如德语夹杂英语产品名)里怎么处理长数字和地址?
PH 用户
这不支持尼泊尔语吗?
PH 用户
恭喜你们发布!有几个问题:
1. 网站上列出了支持的语言比如印地语,但在 playground 上找不到对应的语音。

2. 我看了 TTS 的 WebSocket streaming API... streaming API 能像 ElevenLabs 那样支持多上下文吗?未来有计划吗?

干杯!
热门产品Garry Tan2026-05-28原文

相关内容