论文研究普通
安全为谁而设?边界感知自蒸馏实现话题内精准拒绝
原始标题:Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
内容摘要
Hugging Face 新论文提出边界感知自蒸馏方法,解决模型安全对齐中"话题级拒绝"过于粗糙的问题。该方法通过升级重试策略将训练数据覆盖率从丢失 19.88% 提示词降至 0.20% 残差失败。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hugging Face:Blog(RSS)
站内情报编号intel-0aa0849d72f64dc9e374f8cc