AI圈报
论文研究普通

Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理

信息来源:Apple Machine Learning Research(RSS)·
原始标题:Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

内容摘要

多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-346ab7d0db49f40d72ec006b