行业新闻

OpenAI releases new voice models for more natural live conversations

OpenAI releases new voice models for more natural live conversations

OpenAI says its new voice mode can speak and listen at the same time, a key ability for live translation.

正文摘录

OpenAI 今日发布了新的对话模型 GPT-Live-1 和 GPT-Live-1 mini,声称它们听起来更自然,并能更好地处理轮流发言。这些是全双工模型(全双工模型指同时能说话和聆听),这意味着它们可以同时说话和聆听,允许用户自然地打断,并支持实时翻译等功能。 该公司还在 ChatGPT 中默认用 GPT-Live-1 mini 替换了当前的 Advanced Voice Mode。付费用户将能够访问更大的 GPT-Live-1 模型。之前的模型将语音转文本模型(将语音转录为文字)、大语言模型(生成回复)和文本转语音模型(输出最终回答)组合在一起。 OpenAI 在媒体简报中表示,新模型解决了诸如在用户说话时打断用户、以及不够智能以回答问题等问题。OpenAI 的新模型会将查询发送到其最新的文本模型(如 GPT-5.5)以获取搜索、推理或代理能力(代理能力指模型能自主执行任务),同时继续对话。 OpenAI 还展示,该模型可以长时间保持沉默,吸收对话上下文,直到被召唤时才回应。此外,由于新的语音模式可以访问更新的 GPT 模型,它还能以视觉格式呈现一些信息。其他初创公司,如 [从 DST 和 Lux Capital 获得了 4000 万美元种子轮融资的 Monogram](https://x.com/erenbali/status/2074502671600672930),也在加强视觉响应,使助手更具交互性。 该公司表示,ChatGPT 中的新语音模式旨在进行更长时间的对话。在简报中,ChatGPT Voice 的产品负责人 Atty Eleti 提到,他曾在散步时使用语音功能进行了 30 到 40 分钟的对话。 OpenAI 认为,对于复杂工作,语音可能成为主要的计算界面。

阅读原文(techcrunch.com)→

行业新闻Ivan Mehta2026-07-08原文

相关内容