论文研究普通
X2Streaming-TTS 零前瞻流式语音合成
原始标题:Most "streaming" TTS systems still wait for a complete sentence before speaking. X2Streaming-TTS re…
内容摘要
自变量推出 X2Streaming-TTS,可在文本 token 到达时即时生成语音,严格零前瞻,单请求 TTFT 中位数 15.8 ms,64 并发请求下低于 120 ms。它用因果承诺机制暂存歧义数字、单位和符号,并以语音状态继承跨片段保留音高与音色;在 6/8 项流式评测中识别错误最低,数字与流式歧义测试 CER 为 0%,质量与所评测的离线基线相当。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:自变量 X Square (@XSquareRobot)
站内情报编号intel-c300b60d1935729c271e3bf9