论文研究普通
循环 MoE 的缩放定律:首次联合建模循环与稀疏性
原始标题:Scaling Laws for Looped Mixture of Experts
内容摘要
研究提出 Loop Scaling Laws,首次将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验显示稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cbf634b74e7207d0c2d40166