论文研究普通
Microsoft 与加州大学圣地亚哥分校提出 TailSFT:过滤已拟合样本可提升后续 RL 表现
原始标题:New Microsoft plus Univ of San Diego paper shows a model can look better after SFT but actually be a…
内容摘要
Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-94b946aa0c49551c9d3e924f