AI圈报
论文研究普通

RetireOPD:面向智能体强化学习的自退役同策略蒸馏

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

内容摘要

RetireOPD 提出自适应退役机制的同策略蒸馏方法:先用环境奖励训练技能条件教师,再让无技能学生联合 RL 与 OPD 训练,当师生差距不再缩小且学生达到教师成功率目标比例时自动弃用教师、仅用 RL 继续训练。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-0e0d2c5f1727fe0dd89b9f55