论文研究精选
为什么MiniMax大语言模型无法说出"马嘉祺"?稀疏Token遗忘的内部调查
原始标题:Why Can't the MiniMax LLM Say "Ma Jiaqi"? Internal Investigation of Sparse Token Forgetting
内容摘要
MiniMax M2系列大语言模型在生成时无法输出稀疏token"嘉祺"(如"马嘉祺")。内部调查排除tokenizer对齐问题,发现根因是后训练阶段对低频token的生成概率产生抑制。该问题已在后续模型更新中修复,并顺带解决了其他小语种混合问题。