论文研究普通
APPL:用智能体先验引导策略学习,打通技能组合与泛化
原始标题:Agent Priors-guided Policy Learning
内容摘要
Agent Priors-guided Policy Learning(APPL)将每个策略的结构先验同时用作训练约束与组合接口:构建智能体把完整演示切分为可复用技能,为每个技能提出多个结构先验并逐一训练、验证策略,运行时智能体再按先验选择并组合这些策略。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-5f56febf25de1ab4b3bdb969