论文研究普通
无需推理轨迹的专家模型训练:面向领域专家蒸馏的隐式监督研究
原始标题:Training Specialist Models without Reasoning Trajectories for Domain Expert Distillation
内容摘要
研究发现,仅用问答对训练的领域专家模型会隐式选择潜在推理轨迹空间,且这种分布漂移可直接控制。在 27 组专家-学生模型配对中,二者的专业化-泛化表现高度相关,蒸馏学生模型会系统性继承专家模型的特性,即使跨模型家族也成立。该结论在化学、物理和多语言场景中得到验证,表明缺乏黄金推理时,微调选择直接决定传递给下游模型的隐式监督。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-7cabf155b8ab0a8992c3c8eb