论文研究普通
从强化学习视角看 OPD:面向样本高效 LLM 推理的最小二乘策略蒸馏
原始标题:An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning
内容摘要
研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-1aa3f144703b09f79cb4dae7