论文研究普通
Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理
原始标题:Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
内容摘要
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-346ab7d0db49f40d72ec006b