AI圈报
论文研究普通

重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It

内容摘要

研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-46299f474d8a2a2b2cc84300