论文研究普通
模型与执行框架协同进化:在策略专家纠错让弱模型在模仿失效处追赶
原始标题:Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
内容摘要
研究提出一种在策略专家纠错流程,由元级 MLE 智能体自动定位弱模型自身 rollout 中的失败轮次,仅让专家重写该轮,从而在保留模型原生规划风格的同时结合 harness 进化与模型适配的收益。在七项企业智能体任务上,用专家完整轨迹对 Qwen3-Coder 和 Gemma 4 做模仿训练反而使全部七项任务性能下降 4 至 30 分,原因是模仿破坏了模型与 harness 的匹配。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-592809e95064e29cbaf109ef