Model Update2026-09-11OpenAI Blog

GPT-Live-1登陆API:全双工语音对话来了

OpenAI在API中发布了GPT-Live-1,为开发者带来了自然的全双工语音对话能力。该模型指令遵循更强,支持自定义音色,并集成了电话系统,非常适合呼叫中心、语音助手和交互式应用。 全双工能力是最大亮点。这意味着模型可以同时听和说,而不是等用户说完再回应。传统的轮次式语音系统往往显得生硬、迟缓,尴尬的停顿和打断会破坏真实对话的流畅感。GPT-Live-1旨在消除这些摩擦点,让交流更接近与人对话的体验。 除了响应速度,该模型在遵循详细指令方面也有提升,这对需要大规模保持一致、符合品牌调性的交互的企业来说很重要。自定义音色支持让组织可以定义助手的声音,而电话集成则打开了通过标准电话线路部署的大门,这是许多客服运营的硬性需求。 这次发布表明,语音正在成为AI提供商竞争的核心战场。随着文本助手逐渐成熟,流畅进行口语对话的能力可能成为产品在那些客户期望打电话并被理解的市场中的差异化优势。 对开发者而言,GPT-Live-1提供了一种无需拼凑语音识别、合成和对话管理组件就能添加对话式语音的途径。现在的问题是,它在真实环境下的表现如何——背景噪音、口音,以及真实人类对话中那些不可预测的转折。

相关资讯