论文研究普通
StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习
原始标题:StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks
内容摘要
StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、仅在前置子任务完成后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务构建结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。结果表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c2218723a2ca6187b8d59f5e