论文研究普通
BiasReducer:面向奖励模型的自适应偏见缓解框架
原始标题:BiasReducer: Adaptive Bias Mitigation for Reward Models
内容摘要
BiasReducer 提出一种轻量框架,仅编辑奖励模型的线性奖励头,并为每个新数据集自动选择相关编辑,无需重训练。它先用 SAE 风格编码器识别奖励模型敏感的属性(如长度、置信度),再学习调整奖励头的方向和幅度,最后按属性影响力排序筛选编辑。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-26a92f0ea55d5d2a6b7ab5df