论文研究普通
V-Rubrics:基于评分标准的强化学习提升视觉忠实度
原始标题:V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
内容摘要
视觉语言模型常生成与图像证据不符的流畅回答,V-Rubrics 将参考回答分解为原子命题,按视觉忠实度、推理一致性和指令遵循三维度评分,提供结构化部分奖励。研究基于 Qwen3-VL-8B-Instruct 微调,构建 50,248 条训练集,实验显示基于评分标准的 GRPO 优于共享 SFT 基线和仅答案 GRPO,在知识导向和视觉推理基准上提升最大。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-0737bfa1875a0f12c45911d1