AI圈报
论文研究普通

LexReward:面向法律语言模型的分类体系驱动奖励框架

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

内容摘要

LexReward 是一个面向法律语言模型的分类体系驱动奖励框架,从 Style、Element、Chain 三个维度刻画法律回答质量,并据此构建成对偏好数据用于 DPO 与奖励模型训练。实验显示,基于评分细则的奖励能可靠区分不同质量的法律回答,DPO 训练在三个维度上均带来提升;所训练的奖励模型 LexRM 可在无需参考答案的情况下,通过强化学习分别提升对应维度的策略表现。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ee1f857750e44a88603c038d