OpenAI于近日正式宣布将全新模型GPT-Live-1引入API,为开发者打造全双工实时语音应用及业务流程提供核心支撑。该模型的推出,标志着AI语音交互正在从传统的“分段式处理”向真正的自然对话演进。

在核心技术架构上,GPT-Live-1实现了语音理解与语音输出在同一模型中的深度整合。它打破了传统模式中“语音转文字、大语言模型推理、文字转语音”的多次衔接壁垒,从而大幅降低了系统延迟。该模型全面支持全双工对话,不仅能让系统在输出语音的同时依然聆听用户的声音,还能在对话过程中精准处理打断、停顿以及背景噪声等复杂场景。

OpenAI正式上线GPT-Live-1 API:支持打断处理、工具调用与电话智能体

除了流畅的交互体验,GPT-Live-1在功能扩展和场景落地上也展现出极高的灵活性。开发者可以通过系统提示词轻松调整模型的语气、语速和对话风格,并配置后端模型、工具及智能体框架。同时,该模型支持原生语音识别转写和回复文本,具备字母数字理解、关键词偏置及轮次检测能力。它可以与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。在实际应用场景中,它能够无缝切入电话场景,胜任餐厅预订、客户服务等全双工语音智能体任务。

实际应用层面的成效同样显著。在早期评估中,语言学习平台Speak接入GPT-Live-1后,学习者在思考停顿期间的误打断次数较此前基于轮次的系统减少了将近80%;医疗服务平台也通过该模型精简了架构,大幅削减了代码量。在OpenAI公布的评测中,GPT-Live-1在Full Duplex Bench测试中的表现比GPT-Realtime-2.1高出30个百分点,并在搭配GPT-6Astra中等推理强度时,在Tau3端到端语音智能体任务测试中荣登榜首。

目前,GPT-Live-1已正式在API中提供,其前端语音层的定价为每分钟0.05美元(按每小时计算约为3美元),后端模型和智能体工具的费用另行计算。与此同时,OpenAI还进一步扩展了其实时语音选项,新增了Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等多款全新声音,并计划在未来数月内持续增加更多的语音和语言支持,全面加速智能语音生态的普及。