产品发布 / 更新普通
小米MiMo-V2.6强化学习训练进展公开
原始标题:Nearly half a year of silence. We spent it studying one problem: how far RL can scale. MiMo-V2.6 is…
内容摘要
小米MiMo-V2.6正处于RL训练中,团队从三方面扩展规模:计算(每步约2B tokens,1568条prompt×16次rollout,全异步)、环境与harness(多任务agentic RL,单次运行混合多种harness)、评分计算(agentic组内信用分配,结合测试用例与rubric奖励)。团队称已研究RL能扩展到多远,将在未来几周逐步开源细节,并直播训练过程。
内容分类AI 产品发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:罗福莉 (@_LuoFuli)
站内情报编号intel-935e41cec6435b66b010c811