7 月 8 日,OpenAI 发布了 GPT-Live,一个基于全双工架构的新一代语音模型。它能够同时听和说,在对话进行中产生「嗯」「明白」等自然回应,也可以在用户思考时保持沉默。这是 ChatGPT 语音功能自上线以来最大的一次架构变更,也是 OpenAI 在两周之内继 GPT-5.6 系列和 ChatGPT Work 之后的第三次重要发布。
过去十年,从 Siri 到 Alexa 再到 ChatGPT 高级语音模式,语音助手一直在解决同一个问题:机器必须等你说完才能回应。这个「说完我再说」的轮换模式,让所有语音交互都保留了一丝对讲机的僵硬感。GPT-Live 通过全双工设计和对深度推理的解耦,把这两件事同时解决了。
三代语音架构:全双工到底改变了什么
要理解 GPT-Live 为什么不同,需要回到 ChatGPT 语音的三代架构演进。
初代 ChatGPT 语音采用级联流水线——语音转文本模型转录用户的话,大语言模型生成回复,文本转语音模型读出结果。三个模型串行工作,信息在每个环节都可能丢失,响应缓慢且生硬。
第二代是 2024 年推出的轮换式语音(Advanced Voice Mode),将音频处理折叠进单一模型,延迟显著降低。但它仍然依赖基于静音的轮次检测——用户停止说话才触发回应。一次咳嗽、一段背景噪音、一个思考时的停顿,都可能被误判为「轮次结束」,导致模型在不合适的时机打断。
GPT-Live 引入了 OpenAI 称为连续交互的架构。模型不再等待一个明确的轮次结束,而是持续处理音频输入流的同时生成输出流,每秒多次做出决策:说话、继续听、暂停、打断,或者调用工具。
从工程角度看,这意味着语音模型第一次不需要一个独立的「轮次检测器」来管理对话节奏。在全双工模式下,模型自己判断何时插话、何时沉默。这也是它能够产生「嗯」「好的」这类短暂确认音的原因——模型在用户说话的同时就在生成这些回应,而不是在用户停下之后补一句。
OpenAI 在官方博客中对比了三代语音的对话录音,差异直观可见:级联系统有 2-3 秒的切换停顿,轮换式语音更快但依然机械,GPT-Live 的对话节奏接近两个人自然交谈。
委托推理:这次发布里最重要的设计决策
GPT-Live 最有长期影响的不是音频管线本身,而是它对推理任务的处理方式。
此前所有语音助手都是一个「自己听懂、自己想、自己说」的封闭系统。这意味着语音模型的智力天花板受限于它能在实时延迟预算下跑多大的模型。实际结果是,语音 ChatGPT 一直比文字版 ChatGPT 笨一截。
GPT-Live 换了一种做法。它将自己定位为一个对话前端——负责处理实时语音交互的节奏、语气和流畅度,但遇到需要搜索、深度推理或多步骤任务时,它会将问题委托给后台的 GPT-5.5,拿到结果后无缝融入正在进行的对话。用户可以选择 Instant(即时)、Medium(中等)和 High(深度)三档推理强度。
这个设计的结构性优势在于:语音模型和推理模型可以独立迭代。OpenAI 已经明确表示「随着新前沿模型的发布,将持续更新 GPT-Live 使用的后台模型」。当 GPT-5.6 或未来的 GPT-6 上线时,GPT-Live 大概率不需要重新训练就能直接调用。相比之下,将推理能力内嵌在语音模型中的竞品架构,每次前沿模型升级都需要重新做语音适配。
TechCrunch 引用 ChatGPT Voice 产品负责人 Atty Eleti 的说法:「我们相信语音将成为管理日益复杂的长期 Agent 工作的主要计算界面。」GPT-Live 的委托模式是这个愿景的工程基础——一个轻量、快速的语音前端,加上一个可以不断升级的推理后端。
评测数据与真实差距
OpenAI 公布了 GPT-Live-1 在几个关键基准上的内部测试数据。
在 GPQA(研究生级别科学推理测试)上,GPT-Live-1 高推理模式得分 84.2%,此前的高级语音模式为 45.3%。在 BrowseComp(测试 Agent 级网页搜索能力)上,GPT-Live-1 得分 75.2%,高级语音模式为 0.7%。两项差距背后的原因相同:GPT-Live 可以将复杂问题委托给 GPT-5.5 进行搜索和推理,而旧语音模型只能靠自己。
人类偏好测试中,评估者在 5-10 分钟的配对对话中将 GPT-Live-1 选为更自然的一方,偏好率达到 75.7%。
但这些数据有清晰的边界。首先,所有基准均为 OpenAI 内部评测,第三方独立验证尚未出现。其次,OpenAI 未公开任何延迟数据、词错误率或 API 定价——这三项才是开发者评估语音模型可部署性的核心指标。最后,kie.ai 的分析指出,人类偏好测试的评估者池特征、样本量和具体任务类型均未披露,75.7% 这个数字需要后续第三方复现才能成为可靠证据。
语音战争与 Gemini 阴影
GPT-Live 的发布时间经过了精确计算。Google 的 Gemini 3.5 Pro 计划于 7 月 17 日发布,届时将搭载 200 万 token 上下文窗口和 Deep Think 推理能力。语音是 OpenAI 消费端护城河最强的领域,也是 Google 通过 Android 内置 Gemini 最有可能威胁的领域。
OpenAI 显然不想在 Gemini 3.5 Pro 发布后才追着 Google 打语音牌。GPT-Live 提前 9 天发布,在语音这个子战场上完成了先手占位。Build Fast with AI 在 7 月 13 日的日报中评论:「语音是普通用户用耳朵评判的战争,不像编程基准那样只有开发者关心。OpenAI 显然打算在这场战争中抢先开火。」
苹果和亚马逊也在同一方向上推进。iOS 27 Beta 已允许用户自定义 Siri 的语速和表达风格,亚马逊在新版 Alexa 上增强了上下文处理能力。Oculus 联合创始人 Brendan Iribe 创办的 Sesame 推出了能在后台完成任务的自然对话助手。全双工语音正在从差异化能力变成入场券。
呼叫中心:第一个靶子
技术突破的落脚点往往是最无聊的商业场景。GPT-Live 的第一个明确目标市场是呼叫中心和客服行业。
全球呼叫中心市场估值约 4960 亿美元,AI 呼叫中心细分市场预计从 2025 年的 47.5 亿美元增长到 2031 年的 157.7 亿美元,年复合增长率 22%。成本对比是驱动力的核心:一次 AI 语音通话成本约 0.40 美元,一次人工坐席通话成本 7 到 12 美元。
GPT-Live 触达这个市场的路径有三条。第一,实时翻译能力让一家呼叫中心可以直接服务多语言客户,不需要多语种坐席。第二,委托推理模式允许语音 AI 在通话中实时查询知识库、调取客户历史订单、执行退款操作,而不只是念脚本。第三,全双工架构让客户可以随时打断、追问、纠正,不需要忍受到「请稍等,我查到后再回复」的空白。
OpenAI 在内部评测中还专门包含了一个 τ³-Voice Telecom 测试,针对多轮真实电信客服场景。虽然没有公布具体分数,但将电信客服任务纳入评测本身就说明了目标市场指向。
限制、风险和未回答的问题
GPT-Live 在发布时有多项已知限制。视频和屏幕共享尚未支持,OpenAI 表示「正在引入这些能力」。部分语言存在非母语口音或流利度不足的问题——TechCrunch 在发布会上观察到印地语翻译带有明显的美国口音。API 访问仍处于「即将推出」状态,开发者无法在自己的产品中集成。
安全方面,GPT-Live 的系统卡显示模型在几乎所有安全评估维度上与高级语音模式持平或更优,仅在情绪依赖(从 0.88 降至 0.82)和性内容(GPT-Live-1 mini 从 0.97 降至 0.95)上出现轻微回调,但均未达到统计显著水平。OpenAI 明确强调 GPT-Live 被设计为对话工具而非「AI 伴侣」,使用预定义声线并禁止模仿真人声音。
一个更根本的问题尚未有答案:全双工语音带来了新的调优挑战。Hacker News 上的早期测试者报告了模型在用户还在说话时就笑出声的 bug,OpenAI 后续做了修复。在什么时机插话、什么时机沉默——这个校准参数在全双工架构下变成了一个全新的产品决策维度,调得太激进就是话痨,太保守又回到了轮换模式。
GPT-Live 的两款模型已向全球 ChatGPT 用户推出:GPT-Live-1 作为付费用户默认语音模型,GPT-Live-1 mini 作为免费用户默认模型。九个 ChatGPT 声线均已为此重制。API 开放时间和定价尚未公布。下一个可观测的关键节点是 7 月 17 日 Gemini 3.5 Pro 发布,届时语音领域的竞争格局将进入第二阶段验证。

