AI圈报
论文研究普通

重新思考跨 Tokenizer 的 On-Policy Distillation:从对齐覆盖率到监督可靠性

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

内容摘要

研究重新审视跨 Tokenizer 的 On-Policy Distillation(OPD),发现严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在学生选出的共享词表 top-16 子集即可达到全共享词表 OPD 的精度,并优于所评估的跨 Tokenizer 基线。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-e24fce4e20904308180dd2af