技术

OpenAI语音AI不再等待你说话 — 每分钟$0.05

Susan Hill

目前市面上的每一款语音AI都会告诉你要等它说完再开口。OpenAI的GPT-Live-1不会。这款通过OpenAI API提供的模型能够同时听和说——像人在电话中那样处理打断、停顿和重叠话语。

语音层的定价为每分钟0.05美元——一场30分钟的对话需1.50美元,即每1000分钟对话50美元。开发者需另行为推理后端付费:OpenAI自家的GPT-6 Astra,或者任何能够处理工具调用与业务逻辑的兼容模型。语音层负责对话机制;推理层决定AI真正说什么、做什么。

这种分离在实际中意味着:客服机器人可以在听到“等等,其实我想要另一个选项”这句话说到一半时就做出回应,而不是照本宣科地讲完事先准备好的答案。语言辅导老师可以在学生卡在一个词上时及时纠正,不必等对方讲完。订票系统可以应对真实电话中人们重复自己、改变主意、互相抢话的情形。

在专门用于测试同时双向语音处理的Full Duplex Bench基准上,GPT-Live-1比上一代GPT-Realtime-2.1高出30个百分点。当搭配GPT-6 Astra作为推理后端时,它在Tau3上也位居榜首;Tau3是一个客服基准,测试的是不打断对话的复杂多步查询。

两层架构反映了一个刻意的设计选择。语音时序与推理分开计费,因为二者的扩展方式不同:一家做轻量辅导应用的初创公司在两层上的支出,都会低于一家在GPT-6 Astra上运行数千路并发客服电话的企业。无论后端跑的是什么,语音层的费用下限都是每分钟0.05美元。

GPT-Live-1没有改变的,是答案的质量。语音层决定AI何时说、怎么说,而不是它知道什么。一个时机恰当但内容糟糕的答案,仍然是糟糕的答案。正在构建客服应用的开发者需要分别评估这两层,而推理后端给账单增加的费用可能比语音层本身还多。OpenAI也尚未公布全双工架构在低带宽环境或嘈杂电话线路上的表现数据——在这些场景下,持续的音频输入更难维持。

GPT-Live-1现已通过OpenAI的API提供。公司尚未公布基于该模型的面向消费者的产品,不过它已表示,未来版本的ChatGPT语音模式可能会采用相同的底层架构。每分钟0.05美元的费率适用于上线之初;OpenAI尚未公布价格调整的时间表,也没有公布获准与语音层搭配使用的第三方推理模型清单。

标签: , , , , ,

讨论

有 0 条评论。