AI圈报
论文研究普通

Base Labs 研究:单步梯度更新的"不合理效率"——RL 训练轨迹的线性结构可被利用

信息来源:Baseten Base Labs:模型研究·
原始标题:The Unreasonable Efficiency of a Single Gradient Step

内容摘要

Base Labs 复现了 RL 优化轨迹近似"直线"的结论,发现将 Qwen2.5-1.5B 在 MATH 上的首个梯度步放大 1000 倍,效果超过 500 步 RL 训练的模型(66.7% vs 63.8%)。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Baseten Base Labs:模型研究
站内情报编号intel-d13b418063e2a3d1385de1b7