论文研究普通
数据稀缺下 LLM 的协作式个性化偏好对齐:近似帕累托最优(APO)方法
原始标题:Collaborative Personalized Preference Alignment for LLMs under Data Deficiency
内容摘要
针对用户个性化反馈稀缺导致轻量对齐器难以训练的问题,研究者提出近似帕累托最优(APO)方法,先按更新兼容性对用户分组,再结合梯度下降与受控上升协调相互竞争的目标,学习支持少样本适配的对齐器初始化。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 个本地样本即持续优于现有方法。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cbc6afa554f97f25903ae028