AI圈报
论文研究普通

研究揭示 LLM Agent 后训练中的后门持久性并提出 PersistBD 增强方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training

内容摘要

研究发现,攻击者植入 LLM Agent 的后门在开发者进行监督微调(SFT)后攻击成功率大幅下降,但随后的任务级强化学习(RL)常能保留残余后门行为,有时甚至提升攻击成功率。为此提出的 PersistBD 可在模型发布前优化后门持久性,在 Qwen2.5-Coder-7B 上将 SFT 后攻击成功率从 20% 提升至 74%,SFT-RL 后从 20% 提升至 76%,同时保持良性任务性能相当。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-796efc55eb25ee7346135e5f