模型发布

OpenAI 推出 GPT-Live:把语音栈从客户端到模型重建了一遍

OpenAI 联合创始人 Greg Brockman 公开 GPT-Live 实时音频架构,主打边说边听的全双工能力,意图让推理与工具调用不再打断对话。这一改动是 ChatGPT 语音体验的一次底层换血。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
OpenAI 推出 GPT-Live:把语音栈从客户端到模型重建了一遍

OpenAI 联合创始人 Greg Brockman 在 X 上抛出一则简短但分量不轻的更新:GPT-Live,一个面向实时音频的新架构和新栈。它的核心卖点只有一句话——让模型在说话的同时继续听

这不是一次常规的模型升级,而是把语音链路从客户端到模型层都推倒重做。在 OpenAI 看来,旧栈在自然度、延迟和工具调用之间始终在拆东墙补西墙,要撑住 ChatGPT 级别的并发,必须换一种底层思路。

从“轮替说话”到“边说边听”

过去两年里,主流语音助手几乎都跑在“轮替”逻辑上:用户说完,模型识别,再合成回复,听感上总会有一截等待。GPT-Live 想打破的就是这个节奏,让音频双向流动,对话不再被切成回合

配合这种节奏的不只是流式音频,还有底层推理。OpenAI 表示,更深的推理和工具调用都能在持续音频流里发生,而不必等用户“一口气说完”才启动。这一点的体验差异,比参数表上的任何数字都直接。

为什么语音栈要推到客户端

把语音栈从云端一锅端挪到客户端再造,并不是单纯为了炫技。全双工对延迟的容忍度极低,网络抖动一来体验就崩,重新设计客户端意味着 OpenAI 想把端到端的可控性握在手里。

对开发者来说,这相当于在 API 层之下又多了一个新的工程边界:以后做语音产品,可能不再只是“接一个 LLM”,而是要重新理解一套从端侧采集、传输到模型推理的完整链路。

对中文使用者和开发者的意义

短期内,国内用户最关心的还是何时落地 ChatGPT、何时能稳定用上。在中文场景里,全双工还要解决方言、口音和打断习惯的差异,光把架构搬过来不够。

对做语音产品、AI Agent、陪伴类应用的国内团队来说,更值得盯的是 OpenAI 是否把客户端 SDK、音频编解码和工具调用协议开放出来。如果开放,国内做实时语音助手的玩家会被这一波反向推动一次

接下来值得看的几件事

第一,GPT-Live 是否会成为 ChatGPT 的默认语音形态,还是只作为高级模式;第二,第三方能否通过 Realtime API 拿到同等级别的全双工能力;第三,对算力和带宽的实际占用,会不会让移动端续航和成本先受不了。

把这几件事观察完,再判断 GPT-Live 是“又一次语音升级”还是“AI 对话的底层换轨”会更稳妥。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具