AI圈报
论文研究普通

Diffusion Reward Models:用扩散模型做奖励建模的 DRM 方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Diffusion Reward Models

内容摘要

研究者提出 DRM(Diffusion Reward Model),把奖励建模重构为对 p(r|x,y) 的条件密度估计:以冻结的 LLM 编码器为条件,用轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,从而不预设输出分布并自然刻画人类偏好的多模态结构。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-24630cc980e2bb0de1daa37d