AI圈报
论文研究普通

FlowBalance:基于验证器的自博弈推理经验自我改进方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

内容摘要

FlowBalance 提出一种基于验证器的自改进方法,通过冻结策略视图生成 token 级自引导分数,并与验证器导出的组优势校准,在正优势轨迹上保留引导、负优势轨迹上反转、无偏好时禁用。该方法在数学推理任务上,于 Qwen3-4B 和 Qwen3-8B 上平均性能均超过 FlowRL,同时提升训练速度与稳定性,避免 OPSD 的响应长度坍缩,并在受控 AIME24 诊断中展现更高正确策略多样性。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ae603dbd073bf75e1f5d38dd