AI圈报
论文研究精选

Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

内容摘要

Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cb1fcfe43cdda4bb682a1dbc