论文研究普通
Self-Listening:让全双工语音模型在打断后锚定真实已播内容
原始标题:What Did I Just Say? Self-Listening for Full-Duplex Speech Models
内容摘要
全双工语音模型可同时听与说,但其文本生成、语音合成与音频播放异步进行,导致模型自认为已说的内容可能与用户实际听到的不符。为此研究者提出 Self-Listening 方法,将模型实际播放的语音作为输入流回馈给模型,使打断恢复基于用户真实听到的内容;并推出含同质训练与测试划分的 AnchorSpeech 数据集,实验显示该方法相较全双工基线取得更好的锚定表现。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b27743ad50c1d99d4ed8f2d6