AI圈报
论文研究精选

MaxProof框架:MiniMax M3在IMO 2025和USAMO 2026超越人类金牌线

信息来源:MiniMax:Blog(网页)·
原始标题:MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Evolutionary Search

内容摘要

MiniMax M3采用MaxProof框架,在IMO 2025和USAMO 2026两项数学奥赛基准上超越人类金牌线。框架分三阶段训练:Proof RL使用生成式验证器提供奖励,进行长程强化学习提升证明生成能力;Verifier Alignment将验证对齐为错误定位任务;Refinement Augmentation利用训练中产生的错误证明与验证分析对,通过拒绝采样微调修复能力。三者合并为M3通用模型。系统通过低假阳性率过滤噪声,保证RL稳定性。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源MiniMax:Blog(网页)
站内情报编号intel-cbeae817f083b736ef0c1195