论文研究普通
DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配
原始标题:DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
内容摘要
Apple 研究者提出 DACA-GRPO,一种可插拔的 GRPO 训练增强方法,用于扩散语言模型的强化学习。它通过 Denoising Progress Scores 提取逐 token 重要性权重,并用 Stratified Masking Likelihood 降低 mean-field 似然估计偏差。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-b3b1950543aeb29601c88141