AI圈报
产品发布 / 更新普通

小米MiMo-V2.6公开大规模RL训练细节

信息来源:X:Nathan Lambert (@natolambert)·
原始标题:One of the coolest at-scale RL resources made public yet! You love to see it.

内容摘要

小米MiMo-V2.6正进行大规模强化学习训练,并公开了训练细节。其RL扩展了三个维度:计算(每步约2B tokens,1568 prompts × 16 rollouts,全异步)、环境与harness(多任务智能体RL,单次运行混合多种harness)以及评分计算(智能体组内信用分配,基于测试用例和评分标准的奖励)。相关细节将在未来几周逐步开源。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Nathan Lambert (@natolambert)
站内情报编号intel-b10752286a34437ee388f965