AI圈报
论文研究普通

RewardVerse:面向视频奖励建模的评分标准引导策略优化

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

内容摘要

RewardVerse 提出基于评分标准(rubric)的视频奖励框架,在评估查询与打分器之间引入动态 rubric 作为中间表示,先显式生成评估标准再进行引导式打分,以缓解直接映射单一分数导致的 scalar drift。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-53779ec4c0d714487a0676dc