AI圈报
论文研究普通

面向LLM偏好对齐的零阶范式 ComPO

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:A Zeroth-Order Paradigm for LLM Preference Alignment

内容摘要

研究者提出零阶对齐方法 ComPO,基于比较预言机从偏好对中提取方向信息,不直接优化可微偏好损失,并在平滑性、梯度稀疏等条件下给出离线方案的收敛保证。在线版本保留离线比较机制,用无标注策略生成做相对参考策略的 reverse-KL 控制。在 Mistral、Llama、Gemma-2、Qwen3 和 Gemma-3 上的实验显示其优于现有直接对齐方法,包括长度控制胜率。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-de2d3da29193316cf06ee736