论文研究普通
Best Practice Critic Optimization:一种稳定的基于评论家的强化学习训练方案
原始标题:Best Practice Critic Optimization
内容摘要
BPCO 提出一种结合 DPPO、奖励范围限定的价值预测、蒙特卡洛价值目标、未归一化策略优势及长度自适应广义优势估计的训练方案,以解决基于评论家的强化学习训练不稳定的问题。在 1.5B 至 30B-A3B 混合专家模型的数学推理任务中,BPCO 一致优于强评论家基线,并在每个提示仅采样一个响应的情况下达到或超过基于组采样的基线。该方案同样适用于基于评分标准的奖励学习,代码已开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-f67f7c48702706cb2a515609