微软发布VibeVoice-ASR语音转文本模型 DailyPapers微软刚刚在Hugging Face上发布了VibeVoice-ASR一个统一的语音转文本模型,可一次性转录长达一小时的音频内置说话人分离、时间戳和可自定义的用户上下文 动态DailyPapers2026-01-21原文 打开互动版