论文研究普通
面向软件工程智能体的类别感知迭代专家训练框架
原始标题:One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
内容摘要
针对仓库级软件工程任务中池化强化学习出现的类别此消彼长问题,研究者提出类别感知的专家训练与策略整合框架,通过同源类别专家交替进行长程 Agentic-miniRL 与 Refresh-Repair-Expand(RRE),并用标签路由多教师同策略蒸馏(MOPD)将专家整合为单一可部署学生模型。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-5813e6a9afc050b7ba7987e1