← 返回新闻列表
TechCrunch AI 🗓️ 2026-07-08 🌍 英文原文

OpenAI 发布新的语音模型,实现更自然的实时对话

原始标题:Latest: OpenAI releases new voice models for more natural live conversations
⚡ 一句话看懂:OpenAI 表示,其新的语音模式可以同时说和听,这是实时翻译的关键能力

OpenAI 今天发布了新的对话模型,称为 GPT-Live-1 和 GPT-Live-1 mini,声称它们听起来更自然,并且可以更好地处理轮流。

这些是全双工模型,这意味着它们可以同时说和听,允许用户自然地打断并启用实时翻译等功能。

默认情况下,该公司还将 ChatGPT 中当前的高级语音模式替换为 GPT-Live-1 mini。

付费级别的用户将能够访问更大的 GPT-Live-1 模型。

之前的模型结合了用于转录语音的语音到文本模型、用于生成响应的大型语言模型以及用于提供最终答案的文本到语音模型。

该公司在新闻发布会上表示,新模型解决了用户说话时打断用户以及没有足够的智能来回答问题等问题。

OpenAI 的新模型将把查询发送到最新的文本模型(如 GPT-5.5),以在继续对话的同时进行搜索、推理或代理功能。

OpenAI 还表明,该模型可以长时间保持沉默,并吸收对话的上下文,直到被调用。

另外,由于新的语音模式可以访问较新的 GPT 模型,因此它还可以以视觉格式呈现一些信息。

其他初创公司如 Monogram、 从 DST 和 Lux Capital 筹集了 4000 万美元种子资金 ,也倾向于视觉响应,以使助手更具互动性。

该公司表示,ChatGPT 中的新语音模式旨在进行更长时间的对话。

在简报中,ChatGPT Voice 的产品负责人 Atty Eleti 表示,他在散步时使用语音功能进行了 30 到 40 分钟的对话。

OpenAI 认为语音可能成为复杂工作计算的主要界面。

有报道称它可能会启动 今年推出一款具有AI功能的耳机 。

不过,它没有提供任何有关硬件产品的信息。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接