论文研究普通
窄边界安全对齐:受控大模型安全拒答的自蒸馏框架
原始标题:Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
内容摘要
一项研究提出窄边界安全对齐框架,通过受控主题生成与有害-良性配对数据,让同一基础模型在不同场景下按需拒答。基于Qwen3-8B的政治说服测试中,经Escalate补全的拒答数据将目标域拒答率从9.47%提至84.75%,三个更广危害基准的平均不安全响应率从26.26%降至0.14%,但XSTest过度拒答从2.00%升至74.00%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ffaba6a468878412d51d3dbf