Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。
论文
·HuggingFace Daily Papers(社区热门论文)
Agon:基于隐式对抗评分的跨模型竞争强化学习框架
— Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning