AI圈报
论文研究普通

Decoy Direction Optimization 提出免微调的事后防御对抗 LLM 消融攻击

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration

内容摘要

论文提出 Decoy Direction Optimization(DDO),一种无需微调的事后权重编辑防御,通过向 MLP 神经元注入高幅值非线性诱饵信号,使 RFA 消融攻击的对比估计器失效。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-48aa9e3d068aa620173d26dd