论文研究普通
Multimodal Flow:在嵌入空间统一语言与视觉的流建模
原始标题:Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces
内容摘要
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunk,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场,并用联合注意力实现跨模态交互。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-74de6c4d5e0df5b3a5dcf2c5