PlayAI开源PlayDiffusion音频编辑模型
轰!PlayAI 刚刚在 Hugging Face 上以 Apache 2.0 许可证开源了 PlayDiffusion - 音频语音编辑模型!🔥
> 保持编辑边界的上下文
> 动态、细粒度编辑,无需重新生成整个音频
> 保持韵律和说话者一致性
关于发布的说明:
> 用于无缝语音编辑的非自回归扩散模型
流程:
> 将音频编码为离散令牌
> 掩码要编辑的部分
> 使用扩散技术,基于更新后的文本对掩码区域进行去噪
> 使用 BigVGAN 解码回波形,保留说话者身份
训练:
> 随机掩码令牌,学习利用上下文(文本、说话者、未掩码音频)预测它们
推理:
> 从完全掩码的序列开始,迭代优化预测
> 使用置信度评分和自适应重掩码来关注不确定的令牌
> 逐步减少掩码(γ 调度)以获得高质量输出
来自 @PlayAIOfficial 的非常令人印象深刻的发布 - 期待他们未来越来越多地拥抱开源和科学!🤗
> 保持编辑边界的上下文
> 动态、细粒度编辑,无需重新生成整个音频
> 保持韵律和说话者一致性
关于发布的说明:
> 用于无缝语音编辑的非自回归扩散模型
流程:
> 将音频编码为离散令牌
> 掩码要编辑的部分
> 使用扩散技术,基于更新后的文本对掩码区域进行去噪
> 使用 BigVGAN 解码回波形,保留说话者身份
训练:
> 随机掩码令牌,学习利用上下文(文本、说话者、未掩码音频)预测它们
推理:
> 从完全掩码的序列开始,迭代优化预测
> 使用置信度评分和自适应重掩码来关注不确定的令牌
> 逐步减少掩码(γ 调度)以获得高质量输出
来自 @PlayAIOfficial 的非常令人印象深刻的发布 - 期待他们未来越来越多地拥抱开源和科学!🤗