论文研究普通
解读 Diffusion Transformer 中的上下文 token:一项可解释性与生成质量研究
原始标题:Learning to Read the Contextual Tokens in Diffusion Transformers
内容摘要
研究提出一种框架,用轻量瓶颈网络将 MM-DiT 中间上下文 token 映射到冻结 LLM 的输入空间,让 LLM 直接根据隐藏表示回答关于生成图像的问题。结果显示,上下文 token 在去噪早期就编码了全局语义,即使输入空提示词仍可解码出图像特定信息,且可读性更高的生成往往获得更高人类偏好分数。基于此提出的 Contextual Alignment 训练技术可提升生成质量与分布覆盖。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-edb257d8f385dc5db59b1a71