热门产品

Gemini 3.8 text-to-speech models

Gemini 3.8 text-to-speech models

谷歌推出的 Gemini TTS 语音合成模型,可在 AI Studio、Gemini API、Vids 等平台生成自定义角色音色与对白,面向开发者与内容创作者。

热门评论

PH 用户
Hey Hunters,这次来 hunt 我真的很兴奋!🚀

Gemini 3.8 Flash 和 Flash-Lite TTS 看起来是 AI 语音生成向前迈出的一大步。真正吸引我注意的是,它把创意声音控制和规模化音频制作能力结合到了一起。

它有 2,000+ 种可直接用于制作的语音、支持 100 种语言、语音复刻、自定义声音角色,还能用自然语言控制节奏、方言和演绎方式,这里的可能性太多了。🔊

Flash TTS 对交互式体验、AI 角色、游戏和讲故事来说似乎特别有意思,而 Flash-Lite 可能很适合大规模有声书制作和配音。

我很好奇——你会先用这些新的 TTS 模型做什么?👀
PH 用户
Sundar Pichai 不是这个产品的制作者
PH 用户
天啊,Gemini TTS 真的真的很不错,我希望这能淘汰掉我们到处都能听到的一大堆糟糕 AI 声音。
PH 用户
这里有意思的点是“direct scene dialogue”这种框架,跟普通 TTS API 相比——大多数语音 API 都要求你自己把一轮轮对话拼起来,接缝很明显。我很好奇它怎么处理角色在一场戏中间的语气变化,比如同一段对话里从平静变成恐慌,又不会听起来像两段不同的语音片段硬粘在一起。
PH 用户
我很好奇 Gemini 3.8 的质量跟 Chirp HD 的声音比起来怎么样
热门产品Sundar Pichai2026-09-24原文

相关内容