OpenAI releases new voice models for more natural live conversations
OpenAI says its new voice mode can speak and listen at the same time, a key ability for live translation.
正文摘录
OpenAI 今日发布了新的对话模型 GPT-Live-1 和 GPT-Live-1 mini,声称它们听起来更自然,并能更好地处理轮流发言。这些是全双工模型(全双工模型指同时能说话和聆听),这意味着它们可以同时说话和聆听,允许用户自然地打断,并支持实时翻译等功能。 该公司还在 ChatGPT 中默认用 GPT-Live-1 mini 替换了当前的 Advanced Voice Mode。付费用户将能够访问更大的 GPT-Live-1 模型。之前的模型将语音转文本模型(将语音转录为文字)、大语言模型(生成回复)和文本转语音模型(输出最终回答)组合在一起。 OpenAI 在媒体简报中表示,新模型解决了诸如在用户说话时打断用户、以及不够智能以回答问题等问题。OpenAI 的新模型会将查询发送到其最新的文本模型(如 GPT-5.5)以获取搜索、推理或代理能力(代理能力指模型能自主执行任务),同时继续对话。 OpenAI 还展示,该模型可以长时间保持沉默,吸收对话上下文,直到被召唤时才回应。此外,由于新的语音模式可以访问更新的 GPT 模型,它还能以视觉格式呈现一些信息。其他初创公司,如 [从 DST 和 Lux Capital 获得了 4000 万美元种子轮融资的 Monogram](https://x.com/erenbali/status/2074502671600672930),也在加强视觉响应,使助手更具交互性。 该公司表示,ChatGPT 中的新语音模式旨在进行更长时间的对话。在简报中,ChatGPT Voice 的产品负责人 Atty Eleti 提到,他曾在散步时使用语音功能进行了 30 到 40 分钟的对话。 OpenAI 认为,对于复杂工作,语音可能成为主要的计算界面。