AI圈报
论文研究普通

Think Before You Score:面向视觉生成的思想奖励模型 TRM

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Think Before You Score: Thinking Reward Model for Visual Generation

内容摘要

研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ae52b49e975083ffe7abc3f5