AI圈报
论文研究普通

Self-OPD:无需教师模型的流匹配模型同策略蒸馏框架

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

内容摘要

Self-OPD 提出一种无需教师模型的同策略蒸馏(OPD)框架,将学生模型自身的随机探索转化为逐步监督信号,避免训练任务专属教师模型的高计算成本及师生分布差异导致的复合误差。该方法在每个时间步将确定性预测分支为 K 个随机 SDE 候选,并与确定性自参考基线比较奖励,通过全分支推拉目标优化速度场。在单一及混合奖励基准上,Self-OPD 均优于此前无需任务专属教师的 RL 和 OPD 方法。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b0bda630064ed27c4de0ceab