A5站长网9月21日消息,快手电商直播技术团队公开了一套实时字幕的工程实现,命名为Live Captioning Engineering。最直接的两个数字是:从主播发声到字幕具备展示条件的端到端延迟,由过去的1.5到2秒压缩到400至500毫秒;字符错误率从7.81%降到3.51%。团队同时说明,这套系统要撑住千万级的持续并发,此前行业内还没有电商直播观看端的大规模实时字幕系统真正跑通。
难点在于场景本身。电商直播间里有大量用户处于通勤、办公或静音环境,声音一旦缺失,价格、规格、优惠这些关键信息也跟着消失。但把字幕搬进直播间,要同时满足一组互相拉扯的目标:延长音频窗口能让模型拿到更完整的上下文,却会增加切句与首字延迟;提高中间结果输出频率能让字幕更早出现,却带来更多修订与视觉跳动;强化价格与优惠词的呈现方便用户抓信息,过度高亮又会破坏画面层级。
工程上,团队把字幕交付拆成四段接力。语音识别把主播的声音流实时转成文字;PTS对齐把识别文本与音视频时间戳对好,保证字幕与口型不脱节;级联分发把结果经服务链路推送到海量观众端;端侧渲染由手机播放器把字幕画出来。四段串成一个闭环,任何一段拖沓,都会直接体现在观众看到的延迟上。
最考验功力的是流式修订。直播语音连续不断,模型边听边改,前一句的识别结果很可能在听到后半句时被推翻。系统必须区分清楚哪句话、第几次修订、该排在时间轴的哪个位置。团队用sentenceId锁定一句完整的话,用revision标记这句话修订到第几版,再由播放器时间线决定修订后的字幕在哪一帧刷新。三者配合,才能在不闪烁、不串行的前提下,把不断变化的字幕稳住。
这套经验的价值超出字幕功能本身。对要搭建高并发实时系统的团队来说,把流式、修订、对齐这三件事讲透,比单纯看识别准确率更有参考价值。字幕也从辅助功能变成了直播的基础能力:它是在音频通道之外,重新建立了一条可阅读、可追踪的信息通路。
团队给出的量化收益是延迟与错误率同步下降,而支撑这一切的是千万级并发下的工程取舍。点播字幕、会议转写早已常见,但把字幕做成电商直播观看端的大规模实时能力,此前没有可参照的完整方案,这也是这套范式被单独拿出来讨论的原因。
A5创业网 版权所有