OpenAI 宣布将 GPT-Live-1 实时语音模型开放至 API 服务,开发者可基于该模型构建具备全双工对话能力的语音应用与业务智能体。模型原生支持对话打断处理、工具调用能力,并新增电话语音场景适配,大幅降低高质量语音智能体的开发门槛。
GPT-Live-1 最早落地于 ChatGPT 语音功能,本次 API release 带来面向产业场景的完整能力开放。依托全双工音频架构,模型可同时收听用户语音并输出语音回复,实时识别对话停顿、插话打断、背景噪声,复刻真人对话中自然的交替发言体验,打破传统语音方案 “说完再应答” 的轮询式交互局限IT之家。
区别于传统 “语音转文字 - 大模型 - 文字转语音” 串联链路,GPT-Live-1 将语音理解与语音生成融合在统一模型内,显著降低对话延迟。实测数据显示,模型回合交互延迟低至 0.798 秒,远优于前代实时语音模型。在客户服务、零售、航空、银行等业务场景评测中,搭配 GPT-6 Astra 后端推理模型时,任务一次完成率较 GPT-Realtime-2.1 实现大幅提升。
本次 API 版本核心亮点包含三大能力: 一是流畅打断处理。模型可实时感知用户插话,随时中断当前语音输出并切换聆听状态,在早期试点案例中,相比传统轮询语音系统,对话无效打断量下降近 80%,显著提升对话自然度。 二是可委派式工具调用。GPT-Live-1 负责实时语音对话管理,可将复杂逻辑推理、API 查询、代码执行等任务委派给后端文本模型或第三方工具,在执行后台任务的同时维持语音对话不中断,适配企业知识库查询、业务系统操作等复杂工作流。开发者可对接 Codex、企业内部系统,实现语音指令驱动业务操作。 三是电话语音智能体原生支持。新增电话线路音频适配能力,开发者可快速搭建面向电话渠道的语音智能体,应用于客户热线、电话预约、语音回访等场景,支持对话中途转接人工坐席,落地企业客服、零售预订等业务。
同时开发者可通过系统提示词自定义语音智能体的音色、语速、对话风格,灵活塑造语音角色。OpenAI 表示,GPT-Live-1 面向企业与开发者开放,可广泛用于智能客服、语言教学、车载语音、电话智能外呼等场景,推动语音智能体从简单问答走向具备任务执行能力的交互式智能助手。
行业观点认为,GPT-Live-1 API 的发布标志实时语音智能体进入落地新阶段。全双工 + 打断 + 工具调用 + 电话场景的组合能力,解决了过去语音 AI 交互生硬、延迟高、无法执行业务动作的痛点,将加速语音智能体在政企、消费、服务业场景规模化落地。
OpenAI 同步公布了模型定价与接入文档,开发者可通过 OpenAI 开发者平台申请 GPT-Live-1 API 调用权限,快速原型验证与产品开发。
