论文研究普通
ActFirst-OPD:让多轮智能体先行动后推理,on-policy 蒸馏最高提速 4.9 倍
原始标题:Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics
内容摘要
研究者提出 ActFirst-OPD,一种"先行动、后推理"的 on-policy 蒸馏训练框架,将环境交互与完整回复生成解耦:学生模型借助参考条件逆动力学推断并执行动作,当实际转移偏离参考轨迹时切换为自主预测下一动作,再异步生成完整 think-then-act 回复接受 token 级教师监督。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-f0e1063820a97d09dd1bc75f