AI圈报
论文研究精选

Agon:基于隐式对抗评分的跨模型竞争强化学习框架

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

内容摘要

Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ed7dace641dffbfe8c44843d