论文研究普通
VLA 强化学习的低秩结构:RL 如何重塑 π_{0.5} 与 GR00T N1.5/N1.6
原始标题:The Low-Rank Structure of VLA Reinforcement Learning
内容摘要
研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π_{0.5}、GR00T N1.5/N1.6 等 flow-based VLA 模型做强化学习后训练,参数更新呈现显著低秩,且高度集中在动作专家的 Timestep Modules 中。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b7776ecaed6a47a0fc674290