论文研究普通
稀疏 Crosscoders 揭示 On-Policy Distillation 机制:学生模型只是重新加权已有特征
原始标题:Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders
内容摘要
研究用稀疏 crosscoders 分析 LLM 推理中的 on-policy distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身特征,学生模型超 98% 高频使用特征的激活率变化在 20% 以内。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-990df4636c9387748a368df5