论文研究普通
RWTD:用奖励加权传输蒸馏对齐一步生成模型
原始标题:Aligning One-Step Generative Models with Reward-Weighted Transport Distillation
内容摘要
研究者提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过特征空间最优传输与不动点回归,构建混合当前与参考分布的自适应目标。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,并在偏好对齐实验中展现出较强的跨奖励泛化能力。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-0883e20e652e646e89dc9099