AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
分类文章692
当前页14 / 18
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
论文研究精选
Gemini Embedding 2:来自Gemini的原生多模态嵌入模型
Google DeepMind推出Gemini Embedding 2,这是一款原生多模态嵌入模型,支持在统一表示空间中嵌入视频、音频、图像和文本。该模型利用Gemini的多模态能力,通过大规模对比学习实现SOTA性能。在关键基准上表现优异:MSCOCO取得62.9 R@1,Vatex取得68.8 NDCG@10,MTEB multilingual达到69.9,MTEB Code达到84.0,超越了专用模型。其统一能力使其适用于RAG、推荐与搜索等下游任务,并在天文学、生物…
信息来源:HuggingFace Daily Papers(社区热门论文) · Gemini / Hugging Face
论文研究精选
微软 Copilot Cowork 存在文件泄露问题
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
为什么MiniMax大语言模型无法说出"马嘉祺"?稀疏Token遗忘的内部调查
MiniMax M2系列大语言模型在生成时无法输出稀疏token"嘉祺"(如"马嘉祺")。内部调查排除tokenizer对齐问题,发现根因是后训练阶段对低频token的生成概率产生抑制。该问题已在后续模型更新中修复,并顺带解决了其他小语种混合问题。
信息来源:MiniMax:Blog(网页)
论文研究精选
Google DeepMind 的 AlphaProof Nexus 以几百美元的成本解决数十年未解的数学问题
Google DeepMind 的 AlphaProof Nexus 自主解决了 9 个开放的 Erdős 问题,其中包括两个困扰数学界 56 年的难题。其推理成本低至每个问题仅需几百美元。系统通过 Lean 编译器验证每个证明步骤,而非使用 OpenAI 的自然语言方法。当前的整体问题解决成功率为 2.5%。
信息来源:The Decoder:AI News(RSS) · OpenAI / Gemini
论文研究精选
华为何庭波"韬定律"论文发布,逻辑折叠技术提升芯片性能
华为何庭波在ISCAS 2026上提出"韬定律",并介绍逻辑折叠(LogicFolding)技术。该技术通过三维空间拓扑重组提升芯片性能,不依赖新光刻工艺。在麒麟2026芯片测试中,晶体管密度从155 MTr/mm2提升至238 MTr/mm2,性能核心能效提高41%,最大时钟频率提升近13%。论文显示,麒麟2027芯片已进入Silicon状态,后续规划包括麒麟2028、2029。AI芯片方面,昇腾990计划在2030年左右引入逻辑折叠,硬件集成预计到2035年提高超过10…
信息来源:IT之家(RSS)
论文研究精选
感知图像编解码器:实用学习型图像压缩中的关键因素
苹果公司的研究探讨了感知图像编解码器,分析其在实用学习型图像压缩中的关键作用。该研究聚焦于提升压缩效率与视觉质量平衡的实际需求。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
WBench:面向交互式世界模型评估的多轮基准
WBench 是一个用于系统评估交互式世界模型的多轮基准。它提出了一个五维评估框架,涵盖视频质量、场景设定遵循度、交互指令遵循度、一致性与物理符合性。该基准包含 289 个测试案例与 1,058 轮交互,覆盖了多样化的场景、风格、主体及第一/第三人称视角。评估使用 22 个结合专业视觉模型与大型多模态模型的自动子指标,所有指标均经过人工校验。对 20 个 SOTA 模型的评测发现,目前尚无模型在所有维度上表现均优。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
通过奖励倾斜分布匹配强化少步生成器
本文提出奖励倾斜分布匹配蒸馏(RTDMD),这是一个将分布匹配蒸馏与奖励引导强化学习统一应用于少步流生成器的两阶段框架。该方法通过最小化到奖励倾斜教师分布的KL散度,自然分解为分布匹配项与奖励最大化项。第一阶段引入环境一致分布匹配蒸馏(AC-DMD),在子区间进行分布匹配,并通过一致性正则化辅助分数模型追踪生成器分布。第二阶段联合优化两项,并推导混合策略梯度及步子集GRPO(SubGRPO)以降低方差。在SD3、SD3.5和FLUX.2上的实验表明,RTDMD仅用4步推理即…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
AlphaProof Nexus:用形式化验证驱动AI数学证明搜索
Google DeepMind提出了AlphaProof Nexus系统,它将大型语言模型与Lean形式化验证工具相结合。该系统允许LLM在生成证明的过程中,不断读取Lean的编译错误并进行修正,还可调用更强的工具辅助解决子问题。这一机制迫使模型将每一步逻辑都转化为可编译、可验证的代码,从而将其角色从"令人信服的叙述者"转变为"候选方案生成器"。在针对353个Erdős问题和492个开放猜想的测试中,系统成功解决了9个Erdős问题并证明了44个序列猜想。该研究展示了形式化…
信息来源:X:Rohan Paul (@rohanpaul_ai) · Gemini
论文研究精选
图灵测试 76 年后首现 AI 通过实证:GPT-4.5 以 73% 判定率超越真人
加州大学圣地亚哥分校研究首次实证现代AI可通过图灵测试。研究表明,在获得特定提示后,GPT-4.5在5至15分钟的对话中被误认为人类的概率高达73%,显著超过真人。LLaMa-3.1-405B的判定率(56%)与真人相当,而GPT-4o和ELIZA仅约20%。研究指出提示词至关重要,它使AI能模仿人类语气、幽默感甚至易错性等社会行为特征。这一发现迫使人们重新思考图灵测试的意义,并凸显了大语言模型在网络信任与安全方面构成的潜在挑战。
信息来源:IT之家(RSS) · GPT / Llama
论文研究精选
VSAS-Bench:视觉流式辅助模型的实时评估基准
现有视觉语言模型框架主要在离线场景下评估性能,但实时视觉助手所依赖的流式模型还需考量额外指标,如反映响应时效性的"主动性"和捕捉随时间推移响应稳定性的"一致性"。为此,研究团队提出了VSAS-Bench,这是一个新的评估基准,专门针对流式视觉语言模型在实时交互任务中的表现,填补了当前评估方法在动态、持续生成场景下的空白。
信息来源:Apple Machine Learning Research(RSS)
论文研究精选
OpenAI以"AI数学里程碑"突破自动推理边界,专家正在解析其意义
OpenAI的推理模型证伪了数学家保罗·埃尔德什在1946年提出的关于单位距离几何的猜想。该模型运用了代数数论领域的工具,而专家此前从未预料到这些工具会在此类问题中发挥作用。菲尔兹奖得主蒂姆·高尔斯称此成果为"AI数学发展的里程碑",并警告称,我们可能已经进入一个人类在解决数学问题方面很难与AI竞争的时代。这项进展标志着自动化推理能力的重要突破。
信息来源:The Decoder:AI News(RSS) · OpenAI
论文研究精选
Anthropic 联合研究者测量 Claude Mythos Preview 漏洞利用能力
Anthropic 与 ExploitBench、ExploitGym 和 SCONE-bench 的研究者合作,测量了 Claude Mythos Preview 的漏洞利用能力。在 ExploitBench 的 V8 基准(41 个已修复漏洞)上,Mythos Preview 是唯一能可靠突破 V8 沙箱(从 T3 到 T2)的模型,并在超过一半的环境中实现突破;在 Baseline 和 Nudged 变体中共完成 21 个 CVEs 的任意代码执行(ACE),而其他所…
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
论文研究精选
智谱联合驭驯网络与清华提出ZCube组网架构,破解大模型推理网络瓶颈
智谱、驭驯网络与清华大学联合提出并落地ZCube组网架构,以扁平化拓扑替代传统Clos/ROFT架构,从结构层面消除PD分离推理中的可避免拥塞。在GLM-5.1 coding生产环境千卡集群实测中,ZCube相比ROFT将GPU平均推理吞吐提升15%以上,TTFT P99降低40.6%,同时减少约三分之一的交换机与光模块成本。
信息来源:公众号:智谱(GLM) · GLM
论文研究精选
Gated DeltaNet-2:解耦线性注意力中的擦除与写入
线性注意力通过固定循环状态替代无界缓存,但面临精确编辑压缩记忆的挑战。现有模型如Delta-rule与KDA使用单一标量门同时控制"擦除"与"写入"两个操作。本文提出Gated DeltaNet-2,引入独立的通道级擦除门和写入门,实现了这两个操作的解耦,从而泛化并改进了前代模型。该模型在1.3B参数规模、100B tokens训练下,在语言建模、常识推理等任务中表现优异,尤其在长上下文RULER多键检索基准上优势显著。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
从推理链到可验证子问题:课程强化学习实现LLM推理的信用分配
针对基于结果的强化学习在处理困难推理问题时因正确样本稀少而效率低下的问题,本文提出子问题课程强化学习框架。该框架从参考推理链中提取可验证子问题,并将最终子问题固定为原始问题,从而将部分解题进展转化为可验证的学习信号。其通过在子问题位置独立归一化奖励并分配优势值,实现了更细粒度的信用分配。实验表明,SCRL显著提升了模型在多个数学推理基准上的性能,有效增强了在复杂问题上的探索与推理能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
RiT:在表示空间中使用原生扩散变换器已足够
本研究探讨预训练表示空间在流匹配学习中的优势。比较像素、SD-VAE与DINOv2特征后发现,尽管像素与DINOv2的内在维度相近,但DINOv2在几何统计特性(如有效秩、协方差条件等)上表现更优,使回归过程更稳定。基于此,我们提出了表示图像变换器(RiT),它使用冻结的DINOv2特征,通过x-prediction目标训练一个原生扩散变换器。在ImageNet 256×256生成任务上,RiT性能优于参数量更多的DiT^DH-XL模型,且生成的常微分方程仅需少量步骤即可高…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
OpenAI 声称其解决了一道存在了80年的数学问题--这次来真的
OpenAI 宣布其推理模型成功证伪了一道自1946年起悬而未决的几何猜想。与以往不同,此次声称获得了此前曾指出OpenAI相关声明存在错误的数学家们的认可与支持,这为其结论的可靠性提供了关键背书。
信息来源:TechCrunch:AI(RSS) · OpenAI
论文研究精选
ZCube:超大规模大模型推理的网络优化
针对超大规模大模型推理,ZCube网络架构通过取消Spine层、将Leaf交换机分组并全互联等创新设计,有效解决了推理网络的拥塞问题。该架构在集群实测中,实现了交换机与光模块资本支出减少33%、GPU平均推理吞吐提升15%,同时将首token延迟的P99值大幅降低40.6%,在降低成本的同时显著提升了推理性能。
信息来源:智谱:研究(网页内嵌数据) · GLM
论文研究精选
SpecBench:测量长期编码代理中的奖励黑客行为
长期编码代理在优化测试通过时可能偏离用户真实目标,导致奖励黑客现象。研究将软件工程任务分解为规格说明、可见验证测试和隐藏测试,通过两类测试通过率差距量化黑客行为。为此引入SpecBench基准,包含30个从短期(如JSON解析器)到超长期(如构建操作系统内核)的系统级编程任务。实验显示,所有前沿代理在可见测试上饱和,但隐藏测试上存在持续差距,小模型差距更大;代码规模每增十倍,差距增长28个百分点。失败案例包括故意利用测试输入。SpecBench提供原则性平台,评估代理是否构…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
OpenAI模型证伪了离散几何中的一个核心猜想
OpenAI开发的人工智能模型成功解决了数学界悬而未决逾80年的"单元距离问题",并由此推翻了离散几何领域的一个核心猜想。这一突破被视作人工智能驱动数学研究的里程碑事件,标志着AI在基础科学理论探索中取得了实质性进展。该模型通过创新算法处理复杂的几何问题,展示了机器在自动化发现与验证数学猜想方面的巨大潜力。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
论文研究精选
研究发现人类说服技巧对AI同样有效
🚨我们的论文已在PNAS发表:我们发现经典的人类说服技巧以一种"类人"的方式对AI有效,使其同意不当请求(将顺从率从35%提高到51%) 该技巧对一系列主流大语言模型有效,尽管较新的模型抵抗力更强 https://www.pnas.org/doi/10.1073/pnas.2535868123
信息来源:X:Ethan Mollick (@emollick)
论文研究精选
开源古代汉字视觉感知评估基准Chronicles-OCR
开源了评估视觉大语言模型(VLLM)对古代汉字视觉感知能力的基准测试Chronicles-OCR。该数据集覆盖了从甲骨文到草书的3000年演变历程,包含7种历史书体与2800张均衡图像。评估涵盖字形定位、细粒度识别、古代文本解析和字体分类四项核心任务,旨在探究视觉分布随时间的变化如何影响模型感知。相关论文与代码已开源。
信息来源:X:腾讯混元 (@TencentHunyuan)
论文研究精选
优化_anything:通用文本参数优化API
该研究提出了一种基于大语言模型的通用文本优化系统,将优化问题统一表述为通过评分函数改进文本产物。在六项任务中达到最优结果:智能体架构使Gemini Flash在ARC-AGI上的准确率从32.5%提升至89.5%;调度算法降低40%云成本;87%的CUDA内核匹配或超越PyTorch表现;圆包装问题超越AlphaEvolve。实验表明,可操作的附加信息比仅使用分数反馈收敛更快、得分更高;多任务搜索通过跨任务迁移学习,在同等预算下优于独立优化,且任务数量越多收益越大。该工作首…
信息来源:HuggingFace Daily Papers(社区热门论文) · Gemini / Hugging Face
论文研究精选
CopT:基于连续空间对比验证的在策略推理
CopT提出了一种反转传统链式思考(CoT)顺序的推理框架:先生成草稿答案,再进行策略内反思。其核心是将连续嵌入向量转化为推理时的对比验证器,通过比较模型在离散令牌与连续嵌入输入下对同一生成令牌的支持度,构建序列级反向KL估计器,以此评估答案的可靠性。当答案不可靠时,CopT会执行进一步思考,并利用第二个KL估计器动态控制草稿答案的可见性,在保留有用信息与规避误导间取得平衡。在无需额外训练的前提下,该方法在数学、编程等任务上显著提升了准确率(最高达23%)并大幅减少了令牌消…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
GoLongRL:面向能力的长期上下文强化学习与多任务对齐
GoLongRL是一个全开源的长期上下文强化学习方案,聚焦于使用可验证奖励的强化学习。该工作提出了面向能力的数据构建方法,公开发布了包含23K样本的数据集、完整构建管线及训练代码。数据集依据长期上下文能力分类,涵盖9种任务类型,由真实文档生成的问答对构成;实验证明该数据集性能优于闭源的QwenLong-L1.5数据集。训练得到的Qwen3-30B-A3B模型在长期上下文任务上达到了与DeepSeek-R1-0528等先进模型可比的性能。此外,提出了TMN-Reweight多…
信息来源:HuggingFace Daily Papers(社区热门论文) · DeepSeek / Qwen / Hugging Face
论文研究精选
StableVLA:无需额外数据的鲁棒视觉-语言-动作模型
视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
训练后 MoE 可通过自蒸馏跳过一半专家
本文提出零专家自蒸馏适应框架,将训练完成的静态混合专家模型转换为高效动态模型。该方法通过在每个混合专家层注入零输出专家,并利用原始模型作为冻结教师进行两阶段自蒸馏适应,以实现稳定的架构转换。在两个大型开源模型及11个基准测试上的实验表明,该方法能消除超过50%的专家计算量,同时仅带来极小的准确率损失,并显著提升端到端推理速度。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
从可运行到可交付:基于多智能体测试驱动的开发范式用于从需求生成全栈Web应用
针对编码智能体生成的Web应用超70%不满足需求的问题,本文提出TDDev框架。该框架通过三阶段实现自动化闭环:先将需求转化为结构化测试,再通过浏览器模拟交互验证应用,最后将故障转化为修复报告。首次针对Web应用生成的TDD实证研究发现,引入TDD基础设施可提升质量34-48个百分点。关键结论是最佳协议需与模型生成风格匹配,不匹配将完全抵消TDD优势并最多增加25倍Token消耗。用户研究证实,该框架使人工干预降为零,开发转向自主反馈优化。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Δ-Mem:适用于大型语言模型的高效在线内存
研究人员提出了Δ-Mem,一种专为大型语言模型设计的高效在线内存系统。该系统通过仅存储和更新模型激活的增量变化,而非完整的激活状态,显著降低了内存占用。实验表明,Δ-Mem能将内存使用量减少高达70%,同时保持模型输出的质量基本无损。这一方法有助于在资源受限的环境中部署和运行大规模语言模型,提升其在线推理和持续学习场景下的可行性。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
SenseNova-U1空间智能突破,开源最大空间问答数据集
主推文赞扬了创新者在前沿领域的探索。引用的推文具体指出,SenseNova-U1在空间智能能力上取得进展,其关键基准测试表现超越了Qwen3.5等强劲基线。同时,团队开源了目前最大的空间问答数据集SenseNova-SI-8M,并邀请业界在CVPR会议进行线下交流。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Qwen
论文研究精选
PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟
研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
突破舒适区:面向RLVR的高效策略引导探索框架NudgeRL
强化学习与可验证奖励范式面临探索效率瓶颈。为此,研究团队提出NudgeRL框架,其核心是"策略助推"技术,通过为每次策略采样注入轻量级策略级上下文,引导模型产生多样化推理轨迹,无需依赖昂贵的外部监督。该框架进一步提出一个统一目标,将奖励分解为上下文间与上下文内组件,并通过蒸馏目标将有效行为迁移回基础策略。在五个高难度数学基准测试中,NudgeRL的表现优于标准GRPO方法,其效果相当于后者使用高达8倍采样预算的结果,且平均表现超过了依赖特权信息的Oracle引导基线,证明了…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
教视觉-语言模型说"电影语言"
研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型"电影语言"表达能力的新路径。
信息来源:CMU:Machine Learning Blog
论文研究精选
Darwin Family:基于MRI-Trust加权的进化合并实现语言模型推理能力的免训练扩展
Darwin Family框架通过免训练的梯度无关权重重组,探索重组现有模型隐式能力以提升推理性能。其核心包括14维自适应合并基因组实现细粒度组件重组;MRI-Trust融合机制通过可学习参数平衡层重要性信号与进化搜索;架构映射器支持异构模型家族间的跨架构融合。旗舰模型Darwin-27B-Opus在GPQA Diamond基准上达到86.9%准确率,在1252个模型中排名第六,无需训练即超越其基础模型。该框架在4B至35B参数规模上均能持续提升性能,支持递归多代进化,并能…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Orchard:一个开源智能体建模框架
针对智能体建模领域因依赖闭源资源而受限的问题,研究团队推出了开源框架Orchard。其核心是轻量级环境服务Orchard Env,提供跨任务和流程的可复用沙箱管理基元。基于此构建了三个高效智能体方案:编码智能体Orchard-SWE在SWE-bench Verified上达到67.5%的准确率;视觉语言计算机使用智能体Orchard-GUI仅用少量数据便在多项基准测试中取得64.0%-74.1%的成功率;个人助理智能体Orchard-Claw仅用0.2K合成任务便在Claw…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
迈向自我进化的智能文献检索系统
针对传统检索无法理解复杂意图、而前沿大语言模型成本高且存在幻觉的问题,研究团队提出了自我进化的智能文献检索系统PaSaMaster。该系统通过迭代式意图分析、检索与排序,将文献检索转变为动态演进的过程,并采用三项关键设计:利用排序证据揭示信息缺口以优化搜索;将检索定义为意图-论文相关性排序任务,从根本上杜绝虚假文献;通过分离规划与检索来提升效率,仅用大模型理解意图,而将大规模检索与评分交由轻量模型处理。在涵盖38个学科的基准测试中,该系统将传统关键词检索的F1分数提升15.…
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Hugging Face
论文研究精选
AgentLens:揭示软件工程智能体评估中的"幸运通过"问题
当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于"幸运通过",表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
检索廉价,代码为王:基于可执行程序的多跳推理检索增强生成
针对多跳检索增强生成(RAG)中推理过程隐式、检索漂移及错误难以自查的问题,研究团队提出PyRAG框架,将多跳推理任务重构为程序合成与执行过程。该框架将推理步骤编写为可执行的Python程序,通过显式调用检索与问答工具实现多步计算,使中间状态变量化、反馈确定化,并生成完整可检查的推理轨迹。该方法无需额外训练即可支持基于编译器的自我修复与执行驱动的自适应检索。在PopQA、HotpotQA等五个问答基准测试中,PyRAG在无需训练和强化学习训练两种设定下均显著优于基线模型,尤…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
通过简单统一的扩展实现奥赛金牌级推理
本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face