AI圈报
模型发布 / 更新普通

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

信息来源:IT之家(RSS)·

内容摘要

小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源IT之家(RSS)
站内情报编号intel-3893d83e5bbc74dabe8cd6a3