AI圈报
论文研究普通

研究提出用小型语言模型作基于评分标准强化学习的裁判

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Small Language Models as Judges for Rubric-Based Reinforcement Learning

内容摘要

该论文研究小型语言模型能否高效可靠地充当基于评分标准(rubric)强化学习的裁判,并构建 PointRubric 和 RaR-Science-Static 两个逐点评测数据集。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-86e34905deeb90b70c82d372