AI圈报
行业动态普通

小米 MiMo-V2.6 正在进行大规模 RL 训练并公开训练直播

信息来源:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)·
原始标题:Impressive level of openness on such a large run

内容摘要

小米团队称 MiMo-V2.6 目前正处于 RL 训练中途,探索 RL 的规模上限。其扩展了三个方向:算力(每步约 2B tokens,1568 prompts × 16 rollouts。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)
站内情报编号intel-aed31fec80d30113b1550c9c