论文研究普通
Imagine3D-LLM:让多模态大模型先"想象"3D 场景再作答
原始标题:Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
内容摘要
Imagine3D-LLM 让多模态大模型在图像 token 后追加一组可学习的 summary token,将其解码为紧凑的 3D Gaussian Splatting 表示,并以光度重建损失监督、与标准下一 token 预测联合训练。仅 summary token 接受重建监督,却能增强 LLM 底层图像特征的跨帧对应,在多个空间推理与 3D 理解基准上持续优于此前方法。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-9dab93570b9bffe77c035f65