论文研究普通
UMM-Reflection:用交错强化学习让统一多模态模型学会原生反思
原始标题:Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
内容摘要
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-19617a7b542fec4c5942abb1