在嘈杂的人群中精准锁定并听清某个人的声音,人类的听觉系统能够轻而易举地做到这一点,但对于传统的自动语音识别(ASR)模型来说,多人同时讲话的“鸡尾酒会难题”却长期是一个未被彻底攻克的行业痛点。为了解决这一长期困扰业界的难题,小米近日正式开源了工业级目标说话人语音识别大模型 CocktailASR-1。
该模型彻底改变了传统语音识别的任务输入方式,采用基于参考声纹的目标说话人识别机制。用户只需提供一段参考音频,模型便会利用声纹嵌入精准定位目标说话人,在多人混合音频中只转录该特定人物的语音,而其他人说话的内容、混响以及背景噪声均会被自动过滤,从而将复杂的混合音频任务转化为高效的目标说话人识别。

在底层架构设计上,CocktailASR-1采用了一个端到端的大语言模型架构,具体由 D2V2音频编码器、Adapter 以及大模型解码器串联组成,且所有权重均整合在同一个检查点中。在实际使用时,输入格式为将参考音频与目标单声道音频进行拼接,中间插入一秒静音作为分隔。这种设计让模型具备极高的通用性,无论是单人还是复杂的多元场景,无需切换模型即可一气呵成。
多项基准测试数据验证了该模型的强悍实力。在模拟多说话人测试中,其在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上的字错率(WER)分别压低至4.11% 和2.90%。相比之下,同赛道的多款知名模型在混合场景下表现全军覆没,例如在 LibriMix3mix 测试中,部分竞品的字错率高达76% 到121% 不等,而 CocktailASR-1的字错率仅为12.29%,展现出了颠覆性的降维打击优势。即便是面对更具挑战的真实会议录制场景,如 AMI SDM 和 AliMeeting Far,该模型也大幅领先现有的各类解决方案。而在单人场景下,其在 LibriSpeech、WenetSpeech 以及 CommonVoice-zh 等数据集上也实现了全面超越。
除了突破性的识别精度外,该模型在工程落地和实用性方面还具备两大亮点功能。首先是强大的负样本拒识能力。当参考音频对应的人并不参与当前对话时,模型能够直接输出空文本,从而有效防止智能音箱、车载语音助手等智能设备被旁人的声音误触发。测试显示其在多个数据集上的负样本拒识率表现优异。其次,模型支持思维链推理功能,能够在输出最终答案前通过特定的标签展示其判断说话人的推理过程,虽然该功能对精度影响极小,但极大提升了系统的可解释性与调试便利性。
目前,CocktailASR-1的相关代码已在 GitHub 按照 Apache2.0协议正式开源,且具备极简的依赖环境,仅需 torch、torchaudio、transformers 和 soundfile 等基础库即可轻松从 HuggingFace 加载并部署使用。小米此次在语音技术底层逻辑上的全新转向,标志着语音识别正从传统的“捕获所有声音”正式迈向聚焦于“锁定一个声音”的全新发展阶段。
.png)
发评论,每天都得现金奖励!超多礼品等你来拿
登录 在评论区留言并审核通过后,即可获得现金奖励,奖励规则可见: 查看奖励规则