# 大模型的刻意练习

> 龙虾AGI通用实验室 · 2026-08-07

就在几个月前，行业里有一种普遍的疲惫感。

预训练的scaling law在放缓，各家模型的能力排名你追我赶但差距越来越小，技术博客和投资人嘴里开始频繁出现"天花板"这个词。做大模型的朋友跟我吃饭时说了一句话，大意是：该吃的红利吃完了，剩下的都是苦活。

然后几乎是一夜之间，风向变了。

Kimi放出了K3，2.8万亿参数，官方评测全球第三。DeepSeek的新版也有大幅跃升。Qwen同样放出了3.8 max的新版本。社区里有人开始用"fable级别"来形容这一波模型。几个月前还在讨论天花板，现在突然好像天花板被捅穿了。

到底发生了什么？

如果你去问做大模型的人，他们给出的答案大概率是同一个词：强化学习。

但这就引出了一个很自然的困惑。强化学习不是老东西吗？AlphaGo、Atari游戏、机器人控制，那些不都是专用领域的技术吗？怎么现在突然能让通用大模型也变强了？

这个困惑值得认真对待，因为它触及了这一轮AI进步最核心的原理性转变。而要理解这个转变，得先回到一个更基础的问题：传统强化学习的真正瓶颈到底是什么。

## 一、一面锣能教会一个人多少东西

强化学习这个概念并不新。AlphaGo用它下围棋击败了人类冠军，那是2016年的事。更早之前，DeepMind用它训练AI打Atari游戏，一度是深度学习领域最激动人心的方向之一。

这些成就很耀眼，但如果你仔细看，它们有一个共同的特点：全都发生在封闭的、规则清晰的小世界里。围棋是19×19的棋盘，动作就是落子，输赢判定一清二楚。Atari游戏的画面是几十乘几十的像素，动作无非上下左右加一个发射键。

在这种小世界里，强化学习的训练方式是可行的：AI从什么都不会开始，随机尝试，赢了加分输了扣分，反复训练几百万轮，最终在这个特定的世界里变得比人类厉害。随机下围棋虽然菜，但至少能分出胜负，能拿到反馈信号，学习就能启动。

但如果你想用同样的方式训练一个通用助手呢？

任务变成了"回答任何问题""写任何代码""完成任何指令"。从零开始随机生成文本，出来的大概率是一堆乱码。乱码碰不到任何正确答案，也就永远拿不到正向反馈。学习根本无法启动。

不过，这还不是最根本的困难。

更深层的问题在于奖励信号本身的性质。想象一个场景：你在教一个完全不懂中文的外国人学中文，但唯一允许的教学方式是，他每说一句话，你只能敲一面锣，敲一下表示"对"，不敲表示"错"。不能给教材，不能示范，不能解释，只有这面锣。

他能学会中文吗？

也许给他无限的时间，理论上有一丝可能。但实际上，自然语言的复杂度远远超出了"碰巧猜对"能覆盖的范围。发音、词汇、语法、语义、语用，每一层都有巨大的可能性空间，而他唯一的信号来源是一个比特的"对/错"。

这就是传统强化学习面对开放世界时的真实处境。一道数学题，模型生成几千个token的推理过程，最后只得到一个"对"或"错"。几千个token的努力，换回大约一个比特的信息。用这么稀薄的信号从零开始学习"巴黎是法国首都""Python的for循环怎么写""光合作用的原理"，是不可能的。知识是高带宽的信息，必须从大量数据中学习，一面锣承载不了这个量级的信息。

所以传统强化学习的真正瓶颈不是"世界太大"或"计算量不够"，而是"信号太穷"。用一面锣从零教会一个人所有的知识和技能，这件事在原理上就走不通。

理解了这一点，才能理解大模型上的强化学习为什么是完全不同的一件事。

## 二、锣还是那面锣，但人已经不一样了

大模型上的强化学习，算法框架跟传统RL相似，奖励信号同样稀薄，同样是"做对了加分做错了扣分"。那它为什么能成功？

区别只有一个，但这个区别改变了一切：它不是从零开始的。

在做RL之前，模型已经经过了预训练。几万亿个token的书籍、网页、论文、代码，通过"预测下一个token"这个简单而强大的目标，被压缩进了几千亿个参数里。

预训练的监督信号跟RL截然不同。它是极其稠密的：每一个token位置都有标准答案（下一个真实的token），每一个位置都产生梯度。这不是敲锣，这是手把手、逐字逐句地示范。这就是为什么预训练能灌进去海量的世界知识和语言能力，而RL不能。

预训练结束后的模型是什么状态呢？

打个比方，它像一个读过世界上所有书的人。他什么都知道一点，见识非常广，但做事不太靠谱。你让他做一道数学题，他可能洋洋洒洒写了一大段推导，中间夹杂着正确的思路和离谱的跳步，最后答案可能对也可能错。如果你让他做十次同一道题，可能三次对七次错。正确的方法他是"知道"的，但他同样知道很多不正确的方法，而且分不太清什么时候该用哪个。

强化学习在这个基础上做的事情就清楚了：让他做大量的题，做对了的方式加强，做错了的方式抑制。一轮一轮下来，模型不是学到了新知识，而是学会了更稳定地调用自己已有的知识。

回到之前的比方：传统RL是拿着一面锣，对一个完全不懂中文的人从零教学。大模型RL是拿着同一面锣，对一个已经读完了所有中文书但说话还不太利索的人做校准。

锣还是那面锣，信号还是那么稀薄。但后者的起点完全不同，稀薄的信号已经足够帮他校准那些他"差不多会"的东西了。

这就是为什么同样叫强化学习，传统的只能做专用智能，大模型上的能提升通用能力。差异不在算法，在起点。

## 三、那根拴住模型的橡皮筋

但这里有一个自然的疑问。

RL不断地调整模型参数，把某些行为的概率调高、某些调低。预训练辛辛苦苦灌进去的通用能力，会不会在这个过程中被破坏？

这不是理论上的担忧，而是真实发生过的事。DeepSeek做过一个实验版本叫R1-Zero，纯用RL训练，不加任何保护措施。结果模型确实学会了做数学题，正确率提高了。但推理过程变得中英文混杂、语句不通顺、可读性很差。答案是对的，但说的不是人话了。

为什么会这样？

因为RL的目标函数里只有奖励，完全不关心"输出是不是通顺的人话"。预训练时模型之所以说人话，是因为训练目标就是模仿人类文本。RL阶段这个目标被换掉了，梯度只朝奖励高的方向推。只要某种不说人话的输出恰好能拿到同样的奖励，优化过程就没有任何理由维持语言质量。不是模型"忘了"怎么说人话，而是RL根本不在乎它说不说人话。

所以实践中，大模型RL有一个几乎不可或缺的约束机制，叫KL散度惩罚。这个名字听起来很学术，但背后的想法其实很直觉。

KL散度是信息论里衡量两个概率分布差异的一个量。两个分布完全一样时，KL散度为零；差得越远，数值越大。你可以把它简单理解为"两个分布之间的距离"。

具体做法是这样的。RL训练开始前，把当前模型（预训练加上初步微调后的版本）拍一张快照，冻结起来，称为参考模型。这个参考模型在整个RL训练过程中不变，像一个锚点。

然后RL训练时，模型的优化目标不再是单纯的"最大化奖励"，而是同时受两股力的拉扯。一股力朝奖励高的方向推，另一股力把模型往参考模型的方向拉。后者就是KL惩罚：当前模型在某个输入上的输出分布和参考模型差得越远，罚得越重。

可以想象成一根橡皮筋，一头拴在原始模型上。RL可以把模型朝奖励高的方向拉，但走得越远，橡皮筋的回拉力就越大。走太远的时候，回拉力会超过奖励的吸引力，模型就被拉回来了。

这形成了一个动态平衡：模型在奖励信号的引导下改善行为，但又不会跑偏到丢失原有的语言能力和通用知识。R1-Zero出现的那种"答案对但不说人话"的现象，就是因为没有这根橡皮筋。在正常的生产级RL训练中，KL约束是标配，它保证了模型在变强的同时还记得"说人话"。

这个约束还有一个不太直觉但很重要的附带好处：防止模型钻漏洞。

任何奖励函数或验证器都不可能完美。不加约束的话，模型可能发现一些匪夷所思的方式来骗取高分，比如输出一段乱码恰好通过验证器的格式检查，或者无限重复某句话来刷高某个评分指标。这类"作弊方式"的共同特点是：在正常的语言模型看来，它们的概率极低。正常说话的人不会输出乱码，也不会病态地重复同一句话。所以KL惩罚对这类行为的打击特别重，因为它们偏离参考模型的分布太远了。

当然，KL约束不是万能的。如果某种作弊方式恰好长得像正常语言，比如一段听起来头头是道但逻辑其实有问题的推理，KL惩罚就识别不出来。所以实践中防作弊是组合拳，KL只是其中一层。但它至少挡住了最粗暴的退化模式，让RL训练能在一个合理的范围内运行。

## 四、真正被强化的是什么

理解了大模型RL的运作方式之后，有一个更深层的问题值得细想。

现在主流的RL训练，主要在数学和代码这两类任务上进行。选择它们的原因很实际：数学题要么对要么错，代码跑不跑得过测试一目了然，这给RL提供了干净的、不需要人工介入的奖励信号。

但一个值得玩味的现象是，在数学和代码上做完RL训练的模型，其他能力也跟着提升了。写分析报告更有条理了，做长程规划更合理了，在完全不相关的领域也表现出了更好的判断力。

这就很奇怪了。如果RL只是在数学领域强化了模型，那提升应该局限在数学领域才对。为什么会出现这种广谱的溢出效应？

要回答这个问题，需要仔细想一想模型在数学RL中到底学到了什么。

不是数学知识。勾股定理、微积分的规则、概率论的公式，这些在预训练阶段就已经进入模型了。RL没有给模型提供任何新的数学教材。

那是什么？

是一套思考的流程。

没训练过RL的模型做数学题，倾向于一口气写下去，想到哪写到哪，中间可能跳步，可能走入死胡同也不自知，写完就交卷不检查。RL训练之后，模型的行为模式变了：它会在动手之前先规划思路，把大问题拆解成小步骤，关键步骤做完后回头验算一遍，发现矛盾会停下来重新检查假设，不确定的地方会尝试多条路径再比较。

这些不是数学知识，而是认知科学里所说的**元认知**：关于"如何思考"的思考。

元认知有一个核心特征：它天然是跨领域的。"做完验算一遍"这个习惯，在数学题上是检查计算，在写代码时是跑测试，在做商业分析时是检查假设是否成立，在写文章时是通读一遍看逻辑通不通。底层是同一套思维操作，只是应用在不同的材料上。

所以答案就清楚了。强化学习在大模型上真正强化的，不是某个领域的具体技能，而是一种做事的元能力。正因为被强化的东西本身就是通用的，训练虽然在窄领域进行，收益却是广谱的。

这也解释了一个直觉上不太好理解的现象：为什么各家模型都不约而同地选择在数学和代码上做RL。不只是因为这两个领域容易验证对错，更是因为这两个领域对元认知的要求特别高。数学要求你严谨、不跳步、会验证。编程要求你分解问题、调试错误、处理边界条件。在这些任务上磨出来的思维习惯，恰好是在任何领域都有用的"高迁移技能"。

用一句话概括：预训练教的是"知道什么"，RL教的是"怎么想"。

## 五、为什么是现在

既然强化学习这么有用，为什么不早用？

其实一直在用。从2022年底的ChatGPT开始，大模型就用RLHF（基于人类反馈的强化学习）来做对齐，让回答更有礼貌、更安全、格式更好看。但那个阶段的RL更像是在做"包装"，主要是调整风格和安全性，不太涨硬能力。

转折点是从"人类打分"换成了"客观验证"。

RLHF依赖人类评委打分，这有很多问题：主观、昂贵、速度慢，而且模型会学会讨好评委而不是真正变强（说得好听、显得自信、回答很长，分数就高了）。用可验证奖励做RL则不同，数学题对就是对、错就是错，代码通过测试就是通过、没通过就是没通过，模型讨好不了一个数学定理。

这条路线在2024年底由OpenAI的o1模型走通，2025年初DeepSeek的R1开源了具体方法，全行业快速跟进。

但跑通路线只是起点。真正把RL潜力榨干，需要大量基础设施建设。要有自动生成海量不同难度任务的系统，要有让模型在真实软件环境里操作的沙箱，要有严格判定任务成败且不被模型钻空子的验证器。这些工程上的脏活累活需要时间搭建，现在刚好进入了收获期。

还有一个容易被忽略的因素：RL和预训练是相乘的关系，而不是相加。底座模型越强，模型随机采样十几次中出现正确答案的概率就越高，RL能筛选出来的好行为就越多。当底座规模扩大和RL训练同时推进时，效果是复合增长的。

之前觉得"到头了"，其实是只看到了预训练单条曲线的减速。RL是第二条曲线，它的陡峭上升段恰好接上了预训练的放缓段。两件事叠在一起，就造成了"以为到头了却突然猛涨"的观感。

不是天花板被捅穿了，而是有人在天花板旁边找到了一部新的电梯。

## 六、一个开放的问题

最后聊一个稍微跳出技术的话题。

如果大模型RL真正强化的是元认知，那人类能不能也专门训练元认知？

有意思的是，这种尝试早就存在了，只是没有用"元认知训练"这个名字。数学教育中波利亚的《怎样解题》就是一本纯元认知教材，它不教任何具体的数学知识，只教你"拿到一道题以后应该怎么想"：理解题意、制定计划、执行计划、回顾检查。教育心理学里也有大量研究表明，直接教授元认知策略是有效的：教学生"做完检查一遍""把问题换个说法复述""卡住了就回到已知条件"，确实能提高成绩。

但人类有一个跟模型很不一样的限制：远迁移非常难。

在数学课上练出来的验算习惯，很难自动变成写论文时的自我检查习惯。各种"大脑训练"软件号称能提升通用思维能力，但跨领域迁移效果在研究中普遍不理想。人在一个领域养成的好习惯，换一个领域往往需要从头建立。

而大模型的元认知迁移似乎比人类容易得多。数学题上练出来的严谨，真的会自发出现在写代码、做分析、甚至创意写作中。

为什么会有这种差异？也许原因在于一个根本的结构不同。大模型的所有能力共用一套参数，改变"思考习惯"的参数调整会通过共享权重自动扩散到所有场景。而人类大脑有更强的模块化倾向，不同技能依赖部分独立的神经回路，跨模块的迁移需要额外的、有意识的练习。

这引出了一个有趣的可能性。也许未来的教育可以从大模型RL的经验中获得一些启发。不是照搬算法，而是借鉴那个核心洞察：与其不断地往学生脑子里灌更多的知识，不如花更多时间训练思考的方式本身。

当然，人和模型毕竟是不同的存在，直接类比有其限度。但至少有一点是清楚的：这一轮大模型的能力飞跃，本质上不是"知道更多"，而是"想得更好"。

预训练给了模型一个博学但毛躁的大脑，强化学习把它训练成了一个既博学又靠谱的大脑。

而这个训练过程才刚刚开始。

![](images/e9404b/img_001.png)

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。

如果你也在自己**跑模型、写代码、做项目**，

或者使用**Claude**和**Claude code**，

欢迎**点赞关注转发**一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/e9404b/img_002.jpg)
