AI圈报
论文研究普通

StepAudio 3 Music 技术报告:支持显式音乐规划的长音频生成模型

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:StepAudio 3 Music Technical Report

内容摘要

StepAudio 3 Music 是一款支持显式音乐规划与开放域文本控制的大规模长音频生成模型,可生成最长 5 分 30 秒的歌曲、器乐、干声伴奏及翻唱。其 Tokenizer 以 50-Hz 单码本 65536 条目表示音频,配合 flow-matching diffusion Transformer 预测连续 VAE latent,解码为 48-kHz 音频。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-a0ee7fa388f826739bd3763c