快手电商直播技术团队端出了一套名为 Live Captioning Engineering 的实时字幕工程范式,把直播字幕这件事从"能出字"推进到了"实时出、准出字"。最直接的数字是:主播发声到字幕具备展示条件的端到端延迟,从过去的1.5到2秒压到了400到500毫秒,字符错误率(CER)从7.81% 降到3.51%,背后还要撑住千万级的持续并发——这在以高并发、强实时著称的电商直播场景里,第一次有了一套成体系的工程打法。
这套范式的核心,是把字幕的交付拆成四段接力。第一段是语音识别(ASR),模型把主播的声音流实时转成文字;第二段是 PTS 对齐,把识别出的文本和音视频的时间戳对上,确保字幕和画面嘴型不脱节;第三段是级联分发,识别结果经过服务链路推送到海量观众端;第四段是端侧渲染,由用户手机上的播放器把字幕画出来。四段串起来,才算完成"说话—出字"的闭环,任何一段拖沓都会直接体现在观众看到的延迟上。
最考验功力的是流式修订机制。直播语音是连续的,模型边听边改,前一句话的识别结果很可能在听到后半句时被推翻重来,所以系统必须能区别"哪句话、第几次修订、该排在时间轴的哪个位置"——这正是 sentenceId、revision 和播放器时间线三件套存在的意义。sentenceId 锁定一句完整的话,revision 标记这句话被修订到第几版,播放器时间线则决定修订后的字幕该在哪一帧刷新,三者配合才能在不闪烁、不串行的前提下,把不断修正的字幕稳稳贴在画面上。对想搭建高并发实时 AI 系统的团队来说,这套把"流式、修订、对齐"讲透的工程经验,比单纯的识别准确率更有参考价值。
.png)
发评论,每天都得现金奖励!超多礼品等你来拿
登录 在评论区留言并审核通过后,即可获得现金奖励,奖励规则可见: 查看奖励规则