论文研究普通
DexPolicy:面向轨迹引导灵巧操作的调度式探索方法
原始标题:DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
内容摘要
DexPolicy 将探索噪声尺度设为训练步数的显式函数,从宽到窄退火,在 PPO、GRPO 和流参数化 PPO(FPO)三种设置下提升轨迹引导灵巧操作的成功率。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-464167818cc5a3df6d793a6a