A5站长网9月12日消息,打客服电话时你肯定遇到过这种尴尬:话说到一半,对方系统的语音助手还在自顾自念完那串选项,你只能干等它念完再重按一遍。人类对话里再正常不过的“打断”,在软件里一直是个异常事件。OpenAI这次发布的GPT-Live-1,就是把这件事当成了主要问题来解决——模型通过API开放,支持全双工语音:边听边说,而不是你一句我一句地轮流。
传统语音交互是三级流水线:先识别,再交给语言模型,最后合成。每一级边界都增加延迟,也多一个出错的接缝。GPT-Live-1的思路是把这些接缝拆掉:语音理解和输出在同一个模型里同时进行,打断被当作对话的自然部分原生处理,而不是错误信号。深度推理则委托给后端模型和工具,轻的活现场干、重的活转出去,各干各的。对终端用户来说,最直观的变化是对话节奏像打电话,而不是像对讲机。
对开发者来说,这意味着第三方应用可以做出接近ChatGPT实时语音的对话体验:客服机器人能被用户自然打断并接住话头,语音助手可以在你说话的同时开始组织回答。过去要拼凑语音识别、大模型、语音合成三套服务再调延迟的活,现在一个API就能跑起来。
落地场景不难想象:电话客服、车载助手、实时翻译、游戏NPC配音,全是打断密集型场景。尤其客服这条线,全双工意味着用户不用再听机器把话念完,沟通效率直接上一个台阶。
语音赛道今年明显提速。国内的实时语音通话能力也在这条路上卷,双工、打断、情绪表达正在成为标配参数。给做产品的团队提个醒:语音入口的用户体验门槛在快速抬高,如果你的应用还停留在“按下说话、松开识别”的回合制交互,用户体验的差距会被拉开。9月29日OpenAI开发者大会,预计还会公布更多语音与Agent结合的细节,值得留意。
A5创业网 版权所有