NEXT AI EDITORIAL
GPT-Live-1 API 正式开放:每分钟 0.05 美元,Realtime 语音应用怎么迁移?
GPT-Live-1 API 已开放,语音层每分钟 0.05 美元。本文给出 Realtime 迁移、委派、权限、成本与排障清单。

文章目录
GPT-Live-1 已于 2026 年 9 月 10 日正式进入 OpenAI API,前端语音层按每分钟 0.05 美元、按秒计费。它不是 Realtime API 的原地换模型:会话事件、音频生命周期和工具委派方式都有变化,迁移前应先保留基线对话,再逐项改造。
要点速览
- GPT-Live-1 是全双工语音模型,可以同时听和说,并处理打断、停顿、简短回应与背景噪声。
- 0.05 美元/分钟只包含前端语音层;后端 Responses 模型、Agent、工具和通信线路仍单独计费。
- 浏览器通常用 WebRTC,服务端或电话场景可用 WebSocket;官方还明确支持电话语音应用。
- 从 Realtime API 迁移时,不能继续依赖旧的
response.done或手动提交音频来判断一轮结束。 - 真正高风险的不是“能不能说话”,而是打断后后台任务是否继续、工具调用是否重复,以及播放前是否完成授权确认。
GPT-Live-1 API 到底改变了什么?
传统语音机器人常把语音识别、文本模型和语音合成串成三段,每次交接都会增加延迟,也容易在用户插话时丢失上下文。OpenAI 的正式发布说明称,GPT-Live-1 用同一个语音前端同时处理输入与输出音频,再把复杂推理或工具任务委派给 GPT-6 Astra、其他文本模型或第三方 Agent。
这意味着语音层负责“什么时候听、什么时候说、如何自然回应”,业务后端仍负责查库存、改订单、写数据库与权限判断。官方迁移文档反复强调:提示词可以引导模型,但不能代替应用侧的授权、确认和状态校验。
OpenAI 公布的早期评估显示,GPT-Live-1 相比 GPT-Realtime-2.1 的 Full Duplex Bench 提升 30 个百分点;语言学习应用 Speak 的测试中,思考停顿被误打断的次数接近减少 80%。这些是厂商和设计伙伴结果,正式上线前仍应使用自己的口音、噪声、线路和业务脚本复测,而不是直接套用宣传数字。
价格、限制与适用人群
根据模型页,语音会话每分钟 0.05 美元并按秒结算,不向整分钟取整;后端模型和工具调用按各自标准价格收费。免费层不能创建会话,并发上限从 Tier 1 的 25 路到 Tier 5 的 500 路不等。
它适合电话客服、预约、语言练习、语音陪练与移动端免手操作。若业务只需短语音转文字再返回固定答案,传统 STT—文本模型—TTS 链路可能更便宜、更容易审计;若重点是自然打断、边说边听和后台长任务,GPT-Live-1 的架构优势才更明显。
估算成本时至少拆成四项:语音分钟数、后端输入输出 Token、工具或沙箱费用、电话与媒体流费用。不要只把 0.05 美元乘通话时长就当成总成本。
从 Realtime API 迁移的六个步骤
1. 保存可重复的基线对话
先记录 20—50 条真实但已脱敏的代表性通话:初始状态、用户原话、预期工具调用、最终业务状态和播报内容。至少覆盖沉默、抢话、口音、背景人声、网络抖动与用户临时改口。
2. 拆分语音提示词和业务规则
把语气、语速、是否允许简短附和、何时委派放在 GPT-Live-1 的会话指令中;把库存规则、退款条件、工具参数与确认要求留在后端 Agent。若你的后端正准备采用托管执行,可参考站内的 OpenAI Agents API 接入指南;只做文本工作流时,也可先阅读 Responses API 迁移与 SDK 排障。
3. 选择委派模式
官方迁移指南提供 Responses delegation 与 client delegation。前者由托管 Responses 模型完成推理和工具选择,适合希望少维护一层编排的团队;后者保留现有文本 Agent,由应用传入上下文并回传结果,适合已经有稳定权限系统和状态机的产品。
4. 改造音频事件
Realtime 的 input_audio_buffer.append 要改为 session.input_audio.append,旧的输出音频事件也改为 session.output_audio.delta。GPT-Live-1 持续接收音频并自行判断何时开口,不再需要手动提交音频或强制创建语音回复。输入字幕与输出字幕必须分别追加,因为听和说可能重叠。
5. 把“生成完成”和“播放完成”分开
GPT-Live-1 没有与旧版逐轮 response.output_audio.done 完全对应的信号。客户端应根据本地播放缓冲区维护“正在说话”状态;后台委派完成也不代表声音已经播完。用户打断时,要明确决定只停止播放、取消后台任务,还是保留任务并稍后播报结果。
6. 在应用层执行授权和幂等
预约、付款、发信、删除和修改资料必须在工具执行前重新检查权限,并让用户确认准确对象与时间。为每次委派和写操作保存幂等键,避免断线重连或用户插话触发重复执行。Twilio 的集成说明表明,电话媒体流可以由现成 SDK 接入,但运营商线路、录音告知和地区合规仍是应用方责任。
常见错误与排障清单
- 接上模型却没有声音:检查传输方式、音频格式、浏览器自动播放策略,以及输出增量是否按顺序进入播放队列。
- 用户一停顿就被抢话:用真实口音和噪声重新评测,不要只在安静办公室调参数。
- 打断后订单仍被提交:语音停止不等于后台取消;为委派状态设置
pending / confirmed / cancelled / completed明确状态机。 - 账单高于预期:分别查看语音秒数、后端模型、工具与电话线路账单,限制单次会话时长和最大委派次数。
- 字幕顺序混乱:输入和输出转录分通道保存,不能把所有 delta 塞入同一文本缓冲区。
完成标准
迁移完成不等于 Demo 能通话。上线门槛应包括:代表性对话回归通过;打断不造成重复写入;敏感操作必须二次确认;断线后状态可恢复;费用仪表盘能分解四类成本;人工接管路径可用;录音、转录和保留策略已完成合规审查。若团队还在选择高阶模型与订阅入口,可结合 GPT-6 Astra 套餐与入口说明评估后端模型,而不要把 ChatGPT 订阅额度与 API 账单混为一谈。
总结
GPT-Live-1 的价值是把全双工对话与业务 Agent 解耦:语音前端维持自然交流,后端负责推理、工具和状态。迁移时最重要的不是改一个模型名,而是重做事件、播放、取消、授权与成本边界。先用基线对话小流量验证,再逐步扩容,通常比一次性替换现有语音栈更稳妥。
FAQ
GPT-Live-1 和 Realtime API 是同一个接口吗?
不是。它可以承接 Realtime 应用的目标,但会话事件、持续音频流、委派和逐轮完成信号不同,需要按迁移指南改造。
每分钟 0.05 美元包含 GPT-6 Astra 吗?
不包含。该价格只覆盖前端语音层,后端模型 Token、工具、沙箱与电话线路另外计费。
浏览器和电话都能用吗?
可以。浏览器优先评估 WebRTC,服务端与电话场景可使用 WebSocket及电话集成,但仍要处理线路、录音告知和地区合规。
用户打断语音会自动取消工具调用吗?
不会自动保证。应用必须定义打断策略,并显式取消或保留后台任务,对写操作加入确认和幂等保护。