论文研究普通
ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑
原始标题:ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
内容摘要
ThinkV2V 是一个推理驱动的指令引导视频编辑框架,通过 MLLM-to-DiT 架构让 MLLM 在视觉生成前先对源视频和指令进行显式思考,生成精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,大幅超越 10B 规模基线。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-8a021cd90b1061a9759fc076