论文研究普通
ROSS:通过选择性监督从自生成 rollout 中再学习
原始标题:ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
内容摘要
ROSS 提出一种选择性监督方法,将历史轨迹完整保留为上下文,仅对选定的模型生成续写计算损失,从而复用自生成 rollout 中的行为经验。在 Qwen3.6-35B-A3B 上,ROSS 将六项基准的 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-470714696309018a6e9b1b30