微软在Hugging Face发布实时语音合成模型VibeVoice DailyPapers微软刚刚在 Hugging Face 上发布了 VibeVoice Realtime。一个轻量级的流式文本转语音模型,可在约 300 毫秒内生成初始可听语音,非常适合实时数据和 LLM 对话。 动态DailyPapers2025-12-06原文 打开互动版