论文研究普通
PPO 评论家学习再思考:价值平坦化成因与 SP3O 缓解方法
原始标题:Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
内容摘要
研究揭示 PPO 评论家存在"价值平坦化"失效模式:中间状态的真实价值随 Monte Carlo 延续剧烈变化,评论家预测却相对平坦,且随状态空间增大而加剧。为此提出 SP3O,每条回复仅对少量间隔良好的状态施加价值损失。在 Qwen3-Base 上,每条回复仅监督三个状态即可缓解价值平坦化,并在不同模型规模和评测集上稳定提升策略表现。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-9f9ea69c1aa7cc02bbea84dc