AI圈报
论文研究精选

RVPO:基于方差正则化的风险敏感对齐

信息来源:Apple Machine Learning Research(RSS)·
原始标题:RVPO: Risk-Sensitive Alignment via Variance Regularization

内容摘要

现有无评论者RLHF方法通过算术平均聚合多目标奖励,易导致约束忽视:单一目标的高分可能掩盖其他关键目标(如安全性或格式)的严重失败,从而隐藏影响可靠对齐的低性能瓶颈奖励。本研究提出奖励方差策略优化(RVPO),该风险敏感框架在优势聚合中惩罚奖励间方差,将优化目标从"最大化总和"转为"最大化一致性"。分析表明,RVPO能有效识别并提升瓶颈奖励的贡献,在安全性、格式遵循等多目标对齐任务中实现更均衡的策略优化。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-ae8403018d916e5c47e86650