AI圈报
论文研究普通

VoxMem:面向大型音频语言模型的多模态记忆基准

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models

内容摘要

VoxMem 是面向大型音频语言模型(LALM)的多模态记忆基准,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-03b3e7abb24d74f751a0b84f