行业新闻

OpenAI 发布新语音模型,支持更自然的实时对话

OpenAI 发布新语音模型,支持更自然的实时对话

OpenAI 发布全双工语音模型,让 AI 能同时听和说,实现更自然打断与实时翻译,并已默认部署在 ChatGPT 中。

OpenAI 今日推出 GPT-Live-1 和 GPT-Live-1 mini 两款对话模型。它们采用全双工设计——即可同时说话和聆听,允许用户随时打断,并支持实时翻译。ChatGPT 已默认启用 mini 版本,付费用户可升级至更大模型。新模型不再需要拼接语音转文字、大语言模型和文字转语音三个独立组件,能直接理解对话上下文。

正文摘录

OpenAI 今日发布了名为 GPT-Live-1 和 GPT-Live-1 mini 的新型对话模型,声称其听感更自然,且能更好地处理对话轮次切换。这两款都是全双工(full-duplex)模型,意味着它们可以同时说话和聆听,让用户能够自然地打断对话,并支持实时翻译等特性。 同时,OpenAI 也将 ChatGPT 中现有的高级语音模式(Advanced Voice Mode)默认替换为 GPT-Live-1 mini。付费用户将可以使用更大的 GPT-Live-1 模型。之前的语音模式由三部分组成:语音转文本模型负责转写、大语言模型负责生成回复、文本转语音模型负责最终输出。 OpenAI 在媒体简报中表示,新模型解决了诸如在用户说话时打断对方,以及智能程度不足无法回答问题等问题。OpenAI 的新模型会将请求发送给其最新的文本模型(如 GPT-5.5),以调用搜索、推理或智能体(agentic)能力,同时保持对话继续进行。 OpenAI 还展示了该模型可以长时间保持沉默,在被点名之前一直吸收对话的上下文信息。此外,由于新版语音模式能够访问更新的 GPT 模型,它还可以以视觉形式呈现某些信息。其他初创公司,如 [Monogram(已从 DST 和 Lux Capital 获得 4000 万美元种子资金)](https://x.com/erenbali/status/2074502671600672930),也在尝试通过视觉响应让助手更具交互性。 OpenAI 表示,ChatGPT 中的新语音模式旨在支持更长时间的对话。在简报会上,ChatGPT Voice 的产品负责人 Atty Eleti 提到,他在散步时曾与语音功能进行过 30 到 40 分钟的对话。 OpenAI 认为,对于复杂工作而言,语音可能成为与计算交互的主要界面。

阅读原文(techcrunch.com)→

行业新闻Ivan Mehta2026-07-08原文

相关内容