AI圈报
论文研究普通

PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:PACT: From Credit Assignment to Critic Alignment

内容摘要

研究者提出 PACT(Policy Aligned Critic Training),通过 Actor-then-Critic 更新顺序对 critic 训练施加重要性采样校正,使 critic 与更新后的策略更好对齐。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-6168de0f1a4caf9fbc58223f