Speaking of Voxtral
Mistral AI 发布了开放权重的 Voxtral TTS 模型,主打快速、即插即用且声音逼真,推动语音 AI 应用落地。
Voxtral TTS 是 Mistral AI 推出的前沿、开放权重文本转语音模型,速度快、可即时适应,能生成逼真语音,适用于语音代理。
正文摘录
研究 谈谈 Voxtral 2026 年 3 月 23 日 Mistral AI [返回博客](https://mistral.ai/news/) 5 分钟阅读 分享此文章 复制到剪贴板 已复制   今天,我们发布 Voxtral TTS,这是我们的首个文本转语音模型(Text-to-Speech),在多语言语音生成方面达到业界领先水平。该模型仅有 4B 参数,十分轻量,使基于 Voxtral 的智能体在规模化部署时更加自然、可靠且经济高效。 亮点。 - 在 9 种流行语言中生成逼真且富有情感表现力的语音,支持多种方言。 - 首次音频输出的延迟极低。 - 可轻松适配新语音。 - 可在 [Mistral Studio](https://console.mistral.ai/build/audio/text-to-speech) 中试用。 - 企业级文本转语音,支撑关键语音智能体工作流。 自然的语音生成取决于模型不仅能“背诵”文本,还能准确理解其含义。上下文理解 —— 如中性、开心、讽刺等 —— 决定了听众认为输出是自然的还是机械的。我们的模型在上下文理解和说话人建模(Speaker Modeling)两方面都表现出色:即捕捉特定个体的自然说话方式。我们的语音适配超越了传统的朗读式语音,能够捕捉说话人的个性,包括其自然的停顿、节奏、语调以及情感灵活性。