OpenAI上线GPT-Live-1 API:支持实时打断、工具调用与电话智能体
GPT-Live-1来了:语音交互不再“你一句我一句”
OpenAI最近把GPT-Live-1正式塞进了API里。这不是又一个聊天机器人升级,而是专门冲着“打电话”这件事来的——让AI能像真人一样边听边说,还能被你随时打断。
过去做语音交互,基本是三步走:先把你说的话转成文字,再让大模型思考怎么回,最后把答案念出来。这套流程听起来合理,但实际用起来总卡顿。你刚说完“帮我订个……”,AI就开始念“好的,请问您想订哪家餐厅?”,结果你本来想说的是“帮我订个会议室”,话就被堵回去了。
GPT-Live-1干的事,就是把这三步揉成一步。语音进来的同时,模型已经在理解、生成、输出,整个过程在一个统一架构里跑完。官方说,这样系统延迟大幅下降,最关键的是——它真的能听你“插嘴”。
打断不是bug,是功能
很多人以为语音助手听不懂打断是因为技术不行,其实更多是设计问题。传统系统默认“轮次对话”:你说完,它说;它说完,你再说。一旦你中途插话,系统要么忽略,要么直接乱套。
GPT-Live-1从底层就支持全双工(full duplex),意思是输入和输出可以同时进行。你在它说话时喊一声“等等”,它能立刻停住,转而处理你的新指令。这背后不只是简单的语音检测,还包括对停顿、语气变化甚至背景杂音的判断。
早期接入的教育平台Speak做了个对比:用旧系统时,学生在思考间隙发出的“嗯”“啊”常被误判为新指令,导致AI抢话;换成GPT-Live-1后,这类误打断减少了将近80%。换句话说,AI终于学会“等你说完”了。
不只是说话,还能干活
光会聊天还不够。GPT-Live-1真正厉害的地方在于它能连工具、查系统、执行操作。开发者可以在后台配置它调用哪些函数——比如查询订单状态、修改预约时间,甚至在权限范围内直接下单。
举个例子:你打电话给客服说“我想改明天航班的座位”,GPT-Live-1不仅能听懂,还能通过企业API查到你的订单,确认航班信息,然后调用值机系统帮你换座。如果遇到复杂问题,它还能自动转接人工,并把对话上下文完整传递过去。
这种能力依赖于OpenAI的Presence框架,它允许语音智能体拥有“状态记忆”和“操作权限”。这意味着AI不再是被动应答器,而是一个能主动完成任务的代理。
性能数据:比上一代快不少
OpenAI公布了几组测试成绩。在Full Duplex Bench这个专门评估全双工对话能力的基准上,GPT-Live-1比之前的GPT-Realtime-2.1高出30个百分点。而在Tau3端到端语音智能体任务中,当搭配中等推理强度的GPT-6Astra时,它拿下了第一名。
有家医疗服务平台反馈,接入后整个语音系统的代码量砍掉了一大半。以前要自己拼接ASR、LLM和TTS模块,现在一个API搞定,维护成本直降。
声音多了,价格也明了
这次更新还一口气加了12种新声音:Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder。这些名字听着像咖啡豆,其实是不同风格的语音合成选项,有的偏冷静,有的带点亲和力。
定价方面,前端语音层按分钟计费,每分钟0.05美元,折合每小时3美元。后端模型调用和工具执行另算,具体看用了哪个基础模型(比如GPT-4o还是GPT-6Astra)以及调用频次。
OpenAI说,未来几个月还会继续增加语言和声音支持。目前主要覆盖英语,但西班牙语、日语、德语等也在排期中。
开发者怎么用?
如果你是个开发者,现在就能在OpenAI API控制台启用GPT-Live-1。你需要提供一段系统提示词,用来定义AI的角色、语气、语速,以及它能访问哪些工具。
比如你可以写:“你是一个餐厅预订助理,语气温和,语速中等。你能查询OpenTable API,确认可用时段,并帮用户完成预订。如果用户要求取消,需先验证手机号。”
模型会严格按这个设定运行,同时保持自然对话流。它还能实时返回语音转写的文本,方便你做日志记录或后续分析。
真正的挑战不在技术
技术上,GPT-Live-1确实解决了语音交互的核心痛点。但更大的问题其实是场景适配。比如在嘈杂的街道上打电话,背景音乐、车流声会不会干扰识别?用户说方言怎么办?这些都不是单靠模型能解决的。
另外,电话场景涉及隐私和安全。AI能代表你操作银行账户吗?法律上是否允许?这些问题比技术更难啃。OpenAI目前的做法是把权限控制交给开发者——你可以决定AI能做什么、不能做什么,但责任也得自己担。
别再叫它“语音助手”了
GPT-Live-1的出现,其实标志着一类新产品的诞生:电话智能体(voice agent)。它不是Siri那种问答机器,而是一个能独立完成任务的数字员工。它可以7x24小时接电话、处理请求、调用系统,只在必要时才找人类帮忙。

餐厅、客服中心、预约平台可能是第一批受益者。想象一下,以后打12306订票,接电话的可能是个AI,但它能查余票、选座位、出订单,全程不用你等转接。
当然,离完美还有距离。有时候它还是会误解指令,或者在复杂多轮对话中丢掉上下文。但比起过去那种“请按1,按2”的IVR系统,这已经是质的飞跃。
最后一点:别被名字骗了
虽然叫GPT-Live-1,但它和GPT-4或GPT-5没有直接继承关系。这是个专门为语音优化的独立模型,训练数据侧重对话流、打断处理和实时响应,而不是通用知识。
所以别指望它能现场解微积分——它的强项是“听人话、办人事”。在这个细分赛道上,它目前确实是跑得最快的那个。