AI圈报
论文研究普通

视频中的任意目标定位:重新思考高效的生成式时空视频定位

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

内容摘要

针对现有多模态大模型在时空视频定位中因自回归解码导致的延迟与误差累积问题,研究者提出并行管解码(PTD)方法,将定位分解为时间块与并行的条件空间块,将顺序解码深度固定为1+1轮。在VidSTG基准上,PTD将管完成延迟降低79倍,空间解码吞吐量提升92倍,并提升定位精度;基于40亿参数骨干的模型在VidSTG和HC-STVG上表现良好,并可零样本泛化至时间定位、视频问答等任务。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-fe993de3203cc53c11418c94