AI圈报
论文研究普通

微软论文提出能力洗白攻击:未对齐小模型拆分任务借调前沿模型完成有害目标

信息来源:X:DAIR.AI (@dair_ai)·
原始标题:Interesting safety paper from Microsoft. They find that a weaker, unaligned model can split a harmf…

内容摘要

微软研究团队发布论文,发现较弱的未对齐模型可将有害任务拆成看似无害的子问题,分别在独立会话中询问对齐的前沿模型,再在本地合并答案,作者称之为 capability laundering。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-f673cd2888c5bf4e5906e08c