论文研究普通
CRPO:跨语言排序偏好优化框架,用英语偏好知识提升多语言对齐
原始标题:Language Chain in Alignment: Cross-lingual Ranking Preference Optimization
内容摘要
针对大语言模型对齐依赖英语偏好数据、导致其他语言表现不佳的问题,研究者提出跨语言排序偏好优化框架(CRPO)。该框架在目标语言与英语的平行偏好对中构建层级结构,联合优化语言内与跨语言偏好,并基于LambdaLoss提供多候选响应的相对排序信号。在五种资源规模不同的语言实验中,CRPO在指令遵循和知识利用能力上均稳定优于标准方法,且代码已开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-aa9b62371fc38251f8f9f8e4