Product Launch2026-08-05
OpenAI Blog
OpenAI 揭密即時語音 AI 系統 GPT-Live 技術細節
OpenAI 近日發布技術文章,詳細說明他們如何在短短六個月內打造出 GPT-Live 這套即時語音 AI 系統。這套系統的核心目標是實現「無輪替」(turnless)的語音互動,也就是使用者不必等 AI 講完才輪到自己說話,對話可以自然交疊,整體節奏更接近人類交談,而非傳統語音助理那種「你一句、我一句」的生硬模式。
GPT-Live 的關鍵在於低延遲架構,系統盡可能縮短從使用者發出聲音到 AI 回應之間的時間差,讓對話流暢到幾乎感覺不到機器反應的停頓。OpenAI 在文章中坦言,打造這套系統的技術挑戰不少,例如音訊串流的即時處理、語音辨識的延遲控制,以及在長時間對話中維持上下文連貫性,這些都是過去語音 AI 難以突破的瓶頸。
為了達到自然對話所需的即時反應,OpenAI 團隊在模型推論最佳化與進階音訊處理技術上下了不少功夫。文章中也提到,他們克服了許多工程上的障礙,最終才讓系統具備足夠的靈敏度。這套系統的出現,可能重新定義人機互動的方式,未來在客服、教育、無障礙服務等場景都有很大的應用潛力。
雖然技術細節對一般人來說可能有點複雜,但重點很明確:OpenAI 正在讓 AI 真正具備「聽得懂、即時回應」的能力,一步步把「跟 AI 自然對話」從理想變成現實。