有一件事,做强化学习训练大模型的人可能都遇到过,却很少有人把它说清楚。
你训练一个数学模型去做推理题,每次给它出一道题,让它生成好几个不同的答案。有些题目简单,八次尝试可能七次都对了。有些题目难,八次里可能只对一次。直觉上你会觉得,那道只对一次的答案特别珍贵,它是模型好不容易摸索出来的解法,代表着某种突破。可是现在主流的强化学习训练方法,却把这个珍贵的答案和那些"随便对"的答案,用同一把尺子去衡量、去约束。
这就是这篇论文要解决的问题。
**核心问题:一把尺子量到底,会出什么问题**
要理解这个问题,得先说说现在训练大模型做推理任务的主流套路。
这套路叫做****
RLVR:全称是"带可验证奖励的强化学习",简单说就是给模型出题,答案对了给1分,错了给0分,靠这种明确的对错信号来训练模型。
在RLVR里,最常见的做法叫****
GRPO:一种让模型对同一道题生成一组(比如8个)答案,然后根据这组答案里谁做对了、谁做错了,来计算每个答案该被奖励多少的训练方法。
GRPO的逻辑很简单:如果一组8个答案里有7个人做对了,那么每个做对的人得到的"荣誉"其实不算多,因为大家都做对了,没什么特别的。但如果8个人里只有1个人做对了,那这1个人就显得特别珍贵,会拿到更大的"优势值"作为奖励信号,推动模型往这个方向学习得更狠一些。
这个设计本身没问题,问题出在下一步:**训练过程中要防止模型一次性变化太大,所以会给每次更新设一个"安全绳"**
:在强化学习训练里,为了防止模型一次更新就跑偏太远,会给模型每次调整的幅度设一个上限,一旦超过这个上限就把它硬生生拉回来,这个操作就叫裁剪,英文是clip。
具体来说,模型更新前后,对同一个答案的判断概率会发生变化,这个变化的比例叫做****
重要性采样比:新模型认为某个答案该出现的概率,除以旧模型认为它该出现的概率。如果这个比值大于1,说明新模型更倾向于这个答案;如果远大于1,说明变化很剧烈。
现在的做法几乎都是给这个比值设一个固定的上下限,比如1减0.003到1加0.003之间。一旦某个答案的比值冲出了这个区间,模型就不再按原计划更新,而是被强行截断,防止步子迈得太大摔跟头。
问题来了。论文的作者们发现,那些"稀缺的正确答案"——也就是难题里好不容易蒙对的答案——它们的重要性采样比涨得特别快,因为优势值大,模型对它们的"偏爱"增长得也快。可正因为涨得快,它们反而最先撞上那道固定的天花板,最先被裁掉。而那些"泛滥的正确答案"——简单题目里随便一试就对的答案——它们的优势值小,涨得慢,撞上天花板的时间反而晚。
结果就是:**本该被重点保留、重点强化的探索信号,反而被最先、最狠地掐灭了**
这就好比一个班级里,老师定了个规矩:谁进步超过10分就要被叫去谈话"降降温"。听起来公平,但仔细一想,最容易考90分往100分冲的学生,进步空间本来就小,很难一下涨10分。真正容易一下子涨10分的,往往是那些从30分往40分努力、刚开窍的学生。如果你不管基础分是多少,一律用"涨10分就谈话"这条规矩去卡所有人,那最先被"降温"的,恰恰是那些最需要鼓励、进步势头最猛的学生。如果不区分基础水平,只用一个绝对标准去限制所有人的进步幅度,进步最快的往往最先被摁住,这不是公平,这是在惩罚努力见效的那批人。
论文里专门画了一张图(论文中的图1)来证明这个现象是真实存在的,而不是猜测。图里显示,在训练过程中,无论用GRPO、还是各种变体,"稀缺正确答案"的重要性采样比始终比"泛滥正确答案"涨得快,涨得高。这个现象在几种不同的算法里都反复出现,说明这不是某个算法的偶然缺陷,而是这套裁剪机制本身带来的系统性问题。
那有没有人试着解决这个问题?有,但方向不对。有工作尝试把裁剪的上限整体放宽一些(比如DAPO这篇论文),让所有答案都有更多喘息空间。但作者指出,这治标不治本:**问题不是裁剪区间的绝对宽度不够,而是所有答案共用同一个宽度这件事本身就不合理**
换句话说,你把安全绳放长一点,确实所有人都能多走两步,但走得快的人和走得慢的人之间的相对差距,还是没有被拉开。真正该改的是:走得快的人应该配一条更长的绳子,走得慢的人配一条短一点的就够了。
**方法解读:从一个数学推导,找到"该给多长绳子"的答案**
论文提出的方法叫****
GAPO:全称Group Adaptive Clipping Policy Optimization(组自适应裁剪策略优化),核心思路是让裁剪的上限不再是一个固定数字,而是根据每个答案的优势值大小自动调整,优势值越大,允许的更新空间就越大。
这个想法听起来简单,但论文没有拍脑袋决定"优势值大就多给点空间",而是从一个理论推导出发,一步步论证这个调整应该怎么做。
这里要引入一个概念叫****
信任区域:强化学习里的一个基本原则,指的是每次更新模型的时候,新模型和旧模型之间的"距离"不能太远,否则容易训练崩溃。这个距离通常用KL散度这种数学工具来衡量。
论文借用了一个理论结果:如果你把这个约束反过来写(用"反向KL散度"而不是常规的"正向KL散度",这两者在数学上可以互相替换而不改变结论的正确性),然后去求解"在信任区域约束下,怎样更新概率分布才能让期望回报最大化"这个优化问题,会得到一个很干净的答案。
这个答案是:**最优的重要性采样比,应该和这个答案的优势值成指数关系**
也就是说,优势值越大的答案,理论上该被推高的概率也应该越大,而且这个关系不是线性的,是指数级的。这就给了作者们一个明确的信号:裁剪的上限不该是一刀切,而应该跟着优势值走,优势值大,上限就该松一点。
作者们进一步做了数学上的简化。因为在RLVR里,奖励只有对和错两种(1分或0分),所以一组答案里"做对的人数"只能是有限的几个离散值,比如一组8个答案,做对的人数只能是1到8之间的整数。这意味着优势值本身也只有几种离散取值,不需要用复杂的连续函数去拟合,而是可以直接根据"这组里有几个人做对了"这个统计量,查表一样地算出每个答案该配多宽的裁剪区间。
最终,论文给出了一个非常简洁的公式:裁剪上限等于最低值加上一个调整项,这个调整项由"做对人数"和组的总数决定。做对人数越少(也就是这道题越难、这个答案越稀缺),裁剪上限就越接近允许的最大值;做对人数越多(题目简单,答案泛滥),裁剪上限就压到最低。
这就好比给一个班里的学生调整"允许犯错的空间":那些正在攻克难题、每前进一步都异常艰难的学生,你给他们更多试错和调整的余地;那些已经把简单题目做得滚瓜烂熟的学生,你反而要收紧他们的自由发挥空间,因为他们已经没有太大提升需要,再放纵反而可能过拟合到这些简单题目上。如果不这样区分,把所有学生的"试错额度"设成一样,那些已经掌握简单知识的学生会占用和难题探索者同样多的更新资源,稀释掉真正宝贵的探索信号。
论文里有张示意图(图2)把这个逻辑画得很直观:在传统的对称裁剪下,做对人数最少(也就是优势值最大)的那一行答案,箭头很快就被红色虚线(代表"梯度被裁掉")截断,损失最惨重;而在GAPO的自适应裁剪下,无论优势值大小,每一行答案损失的比例大致相同,做对人数少的答案获得了明显更宽的空间去继续更新。
**实验验证:数字说话**
光有理论不够,论文在好几个模型和好几个任务上做了验证。
用到的模型包括、AIME25、AMC、MATH500这些数学竞赛题,也包括LiveCodeBench和HumanEval+这样的编程任务。
结果显示,在DeepSeek-R1-Distill-Qwen-1.5B上,GAPO在AIME24这个高难度竞赛题上的一次性通过率达到44.0%,而基线方法GSPO是41.3%,提升了2.7个百分点。多次尝试下的通过率(尝试16次里至少对一次的概率)从73.3%提升到76.7%。在AIME25上提升更明显,多次通过率从50.0%涨到56.7%,涨了6.7个百分点。
在Qwen2.5-Math-1.5B上,GAPO在AIME24上的一次通过率是17.9%,而效果最好的基线方法GSPO非对称裁剪版本只有16.2%,另一个加入了难度加权的变体F-GSPO是15.4%。这个差距看起来不算特别大,但要知道AIME是美国数学邀请赛的题目,属于顶尖难度,每提升一个百分点都意味着模型多攻克了一批原本完全无法解答的题目。
论文还专门做了一个统计显著性检验,跑了3个不同的随机种子重复实验,用统计学方法(Welch's t检验)确认这些提升不是偶然的波动。结果显示,在至少6个数学基准测试里的3个以上,GAPO的提升是统计显著的,尤其是在AIME24这种最难的题目上,提升幅度最大也最稳定。
更有意思的是一个"追踪相关性"的实验(论文图5)。作者们全程监测"重要性采样比"和"优势值"之间的相关系数,如果理论是对的,这两者应该保持正相关,因为优势值越大的答案理应获得越大的更新比例。结果发现:**用固定裁剪的方法,这个相关系数在训练中后期会一路跌到负数,说明裁剪机制事实上正在"惩罚"那些本该被鼓励的探索行为;而GAPO全程把相关系数维持在0.8以上**
这个数字非常关键。相关系数从正到负,意味着传统方法训练到后期,其实已经在系统性地打压那些最有价值的探索信号,而这种打压是悄无声息发生的,训练日志上可能只显示损失函数在正常下降,但底层的探索能力已经在被慢慢磨掉。
为了排除这个下滑不是别的原因造成的,作者们还做了一个"介入实验"(论文图7):他们拿一个用固定裁剪训练到第600步的模型,从这一步开始切换成GAPO的自适应裁剪继续训练,结果发现相关系数立刻止跌回升,通过率也随之改善。这个实验相当于证明了:**问题确实出在裁剪机制本身,而不是训练前期的什么其他因素在暗中作祟**
论文还统计了"每道题的解决率"随训练变化的情况(图8)。结果显示GAPO的优势主要集中在中等难度的题目上,那些模型偶尔能做对、但还不够熟练的题目。到训练后期,传统方法在这些题目上的解决率会逐渐下滑,仿佛模型渐渐"忘记"了怎么做这些题;而GAPO能持续保持在超过5%解决率的题目数量是10.9道,明显多于对比方法的6.7到8.6道。
论文附录里还展示了一个具体案例(图9),针对AIME24里一道关于棋盘放置芯片的组合数学题,普通的GSPO方法只生成了3个正确解答,而GAPO生成了28个正确解答,其中还包含了三种完全不同的解题思路,一种是从"给行列染色"入手,一种是"把网格切分成色块",还有一种是"寻找交替模式"。三种思路最后殊途同归,都得到了正确答案902,但推理路径完全不一样。这说明GAPO不只是让模型多蒙对几次,而是真的保留了模型多样化的思考方式,没有让它收敛到单一的解题套路上。
**这个方法为什么"轻"**
GAPO有一个值得单独说说的特点:它几乎不需要改动现有的训练框架。
它没有引入新的奖励函数,没有改变优化目标本身,唯一改动的就是裁剪这一个环节的阈值计算方式。这和另外一类研究方向形成了对比,那类方法喜欢直接去调整"优势值"本身,比如给难题的优势值乘上一个放大系数(论文里提到的F-GRPO就是这么做的)。
论文里明确指出这两种思路的差别:调整优势值,本质上是在改写"这道题该值多少分",这可能会让模型偏离原本"一次做对"这个最直接的训练目标,产生所谓的**pass@1漂移**
pass@1漂移:指的是模型在追求某些间接指标(比如多次尝试里至少对一次的概率,或者答案多样性)的过程中,反而牺牲了一次性做对的能力,这是很多"魔改"强化学习目标函数的方法容易踩的坑。
GAPO没有去动优势值的定义,也没有去动奖励函数,它只是在"信任区域该开多大"这件事上做了精细化处理。这种做法有点像不去改变考试的评分标准,只是针对不同水平的学生调整作业量和自由发挥的空间,评分依然公正客观,但每个人得到的成长空间因材施教。如果反过来去改评分标准本身,虽然短期内可能看起来某些指标更好看,但很容易让整个训练目标跑偏,模型学到的可能不再是"怎么把题做对",而是"怎么让某个替代指标好看"。
论文的作者们也很坦诚地承认了这个方法目前的局限。比如,裁剪区间其实有上限和下限两部分,这篇论文只调整了上限(管着正确答案能获得多大更新空间),下限(管着错误答案该被压制多狠)暂时还是固定的。作者说这是未来可以继续研究的方向,如果连错误答案的惩罚力度也能根据题目难度动态调整,可能会进一步影响模型的探索行为,但目前还没有确切答案。
另外,这套理论推导严格来说只对"单个题目、单次更新"这种理想情况成立,而实际训练中每一批数据里往往混杂着几十上百个不同的题目。作者也承认这中间存在理论和实践的缝隙,只是从实验结果看,这个基于单题推导出来的简化公式,在真实的多题混合训练场景里依然表现得不错。
**写在后面**
读完这篇论文,最触动我的其实不是GAPO这个方法本身有多精巧,而是它揭示的一个更普遍的现象:**很多"公平"的规则,一旦不考虑起点差异,反而会系统性地伤害那些最需要被鼓励的对象**
这个道理放在教育、绩效考核、甚至任何需要设定"统一门槛"的场景里都成立。一刀切的规则看起来最简单最公正,但恰恰是这种简单性,让它对不同处境的个体产生了完全不对等的实际影响。
论文里那张"重要性采样比和优势值的相关系数从正变负"的图(图5),我反复看了好几遍。这个转折点几乎精确对应着裁剪开始大量触发的那个训练步数,这说明模型训练的"探索能力衰退",未必是一个缓慢渐进、无法察觉的过程,很可能存在一个具体的、可以被定位的临界点。如果训练团队能提前监控这类相关性指标,或许就能在模型真正"僵化"之前及时介入。这比事后看着评测分数不涨再回头排查,效率高得多。
还有一点值得琢磨:论文选择用"做对人数"这样一个极简的离散变量,而不是某个连续的复杂公式,来驱动整个自适应机制。这背后其实是在利用RLVR这个场景本身的特殊性:奖励只有对和错两种,这种"贫瘠"的信号反而给了简化模型一个天然的台阶。如果奖励是连续的分数(比如0到100分),这套基于"整数计数"的简洁方案可能就不那么容易直接套用了。这提醒我,好的方法设计往往不是去追求理论上最一般化的形式,而是要老老实实看清楚手头这个具体问题的结构特点,顺着它的纹理去下刀。
模型在训练中途悄悄失去多样性这件事,会不会也在其他领域的强化学习系统里,以我们还没注意到的方式发生着?
Q&A
Q1:GAPO是什么?
A:GAPO全称Group Adaptive Clipping Policy Optimization,是一种改进强化学习训练大模型的方法,核心是让裁剪阈值根据每个答案的优势值大小自动调整,而不是所有答案共用一个固定阈值。
Q2:GAPO和普通的GRPO、GSPO方法有什么区别?
A:GRPO、GSPO等方法用固定的裁剪区间限制所有答案的更新幅度,导致稀缺的正确答案(难题上蒙对的答案)被过早裁剪。GAPO根据答案所在题目的做对人数动态调整裁剪上限,让稀缺答案获得更大更新空间。
Q3:GAPO在实际测试中效果怎么样?
A:在DeepSeek-R1-Distill-Qwen-1.5B模型上,GAPO在AIME24竞赛题上一次通过率达到44.0%,比基线方法提升2.7个百分点,多次尝试通过率也从73.3%提升到76.7%,在多个数学和编程基准上都有稳定提升。