论文研究普通
PlaylistEval:视频语言模型做评判者,在日级长视频上还可靠吗?
原始标题:PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?
内容摘要
PlaylistEval 是一个无需人工标注的智能体框架,可在超过 100 小时的播放列表视频集合上构建视频语言评判基准,自动生成差异由因果退化控制、必须跨集合检索才能作答的问答对。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d970ca04526cfe52cbd5a47c