论文研究普通
EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键
原始标题:EasyPPO: Stabilizing the Critic Is Key
内容摘要
EasyPPO 通过仅对 actor 做超长过滤、按采样回报标准差倒数加权 critic 回归、并适度缩小 critic mini-batch,解决了 PPO 中 critic 的两类失稳问题。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-571b928e5ed9bdb0c8020e49