论文研究普通
噪声出、偏见入:通过闭环激活引导对扩散语言模型实施定向偏见注入
原始标题:Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
内容摘要
研究提出针对冻结扩散语言模型(dLLM)的定向偏见注入攻击,利用去噪过程中答案分布多次暴露的特点,用比例积分(PI)控制器实时跟踪目标答案概率并动态调整引导向量强度。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-2e2ffb2a0434ceff648d7946