AI圈报
论文研究普通

GRAFT:用跨模型轨迹交换提升 RLVR 训练效率

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

内容摘要

针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c29cdfc561765c7390d1d3da