AI圈报
论文研究普通

LastOPD:解决潜在在线策略蒸馏中的性能崩溃

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:LastOPD: Taming Collapse in Latent On-Policy Distillation

内容摘要

研究者在将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base 时发现,潜在监督会让 MATH-500 准确率在 10 步内从 25 升到 46,随后却崩到 11 且无法恢复,而对齐指标仍在持续改善。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cfe2e8994c017abebe33c0c1