论文研究普通
为更强 LLM 后门攻击学习投毒集选择
原始标题:Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
内容摘要
研究发现,固定模型、干净数据和投毒样本数量,仅改变投毒集的选择,LLaMA-3-8B 后门攻击成功率就会从 3% 波动到 80%,随机采样会严重低估最坏情况下的脆弱性。为此作者提出 SAILS,通过数百次微调-评估运行学习集合评分器,对数百万候选投毒集排序并只审计少量候选。SAILS 在留出集上的攻击成功率平均比最强影响力基线高 30 个百分点,并可从小规模迁移到全规模微调。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b79e0af8b2a473b33edefefb