论文研究精选
苹果研究:单个神经元即可绕过大型语言模型的安全对齐
原始标题:A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
内容摘要
苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-0ae9a86b22596fe9aa1f24b2