AI圈报
论文研究普通

DEFINE:用示例音频解耦说话人身份与口音的零样本 TTS 框架

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS

内容摘要

DEFINE 是一个端到端零样本 TTS 框架,通过分别以说话人身份和口音示例音频作为条件,将两者解耦,并可在推理时用单一引导权重连续控制口音强度而无需重训练。它基于 F5-TTS 与 LoRA 适配,在已见口音上把口音探测准确率从 6.5% 提升到 19.6%,单个模型在已见和域外口音上可媲美双模型 TTS-语音转换级联,同时说话人相似度更高。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-1cb9f0483888449edc2f46b5