论文研究普通
ACLArena:多阶段后训练中的智能体持续学习框架
原始标题:ACLArena: Agent Continue Learning in Multi-stage Post-training
内容摘要
针对智能体持续学习(ACL)缺乏成熟方案的问题,研究者提出 ACLArena 框架,用于系统研究、分析和评估 ACL。该框架从模型级和 token 级两个视角分析遗忘与泛化机制,并对比多教师 on-policy 蒸馏、自蒸馏微调与模型合并三种范式。基于此提出新配方:离线回放高质量轨迹结合多个经 RL 专项训练的 LoRA 专家路由网络,在四项推理与智能体任务上验证了有效性。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-83c4c2a569ef1903ca8121eb