龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

大模型的刻意练习

格里灰丝2026-08-07约 5985 字Markdown 原文

就在几个月前,行业里有一种普遍的疲惫感。

预训练的scaling law在放缓,各家模型的能力排名你追我赶但差距越来越小,技术博客和投资人嘴里开始频繁出现"天花板"这个词。做大模型的朋友跟我吃饭时说了一句话,大意是:该吃的红利吃完了,剩下的都是苦活。

然后几乎是一夜之间,风向变了。

Kimi放出了K3,2.8万亿参数,官方评测全球第三。DeepSeek的新版也有大幅跃升。Qwen同样放出了3.8 max的新版本。社区里有人开始用"fable级别"来形容这一波模型。几个月前还在讨论天花板,现在突然好像天花板被捅穿了。

到底发生了什么?

如果你去问做大模型的人,他们给出的答案大概率是同一个词:强化学习。

但这就引出了一个很自然的困惑。强化学习不是老东西吗?AlphaGo、Atari游戏、机器人控制,那些不都是专用领域的技术吗?怎么现在突然能让通用大模型也变强了?

这个困惑值得认真对待,因为它触及了这一轮AI进步最核心的原理性转变。而要理解这个转变,得先回到一个更基础的问题:传统强化学习的真正瓶颈到底是什么。

一、一面锣能教会一个人多少东西

强化学习这个概念并不新。AlphaGo用它下围棋击败了人类冠军,那是2016年的事。更早之前,DeepMind用它训练AI打Atari游戏,一度是深度学习领域最激动人心的方向之一。

这些成就很耀眼,但如果你仔细看,它们有一个共同的特点:全都发生在封闭的、规则清晰的小世界里。围棋是19×19的棋盘,动作就是落子,输赢判定一清二楚。Atari游戏的画面是几十乘几十的像素,动作无非上下左右加一个发射键。

在这种小世界里,强化学习的训练方式是可行的:AI从什么都不会开始,随机尝试,赢了加分输了扣分,反复训练几百万轮,最终在这个特定的世界里变得比人类厉害。随机下围棋虽然菜,但至少能分出胜负,能拿到反馈信号,学习就能启动。

但如果你想用同样的方式训练一个通用助手呢?

任务变成了"回答任何问题""写任何代码""完成任何指令"。从零开始随机生成文本,出来的大概率是一堆乱码。乱码碰不到任何正确答案,也就永远拿不到正向反馈。学习根本无法启动。

不过,这还不是最根本的困难。

更深层的问题在于奖励信号本身的性质。想象一个场景:你在教一个完全不懂中文的外国人学中文,但唯一允许的教学方式是,他每说一句话,你只能敲一面锣,敲一下表示"对",不敲表示"错"。不能给教材,不能示范,不能解释,只有这面锣。

他能学会中文吗?

也许给他无限的时间,理论上有一丝可能。但实际上,自然语言的复杂度远远超出了"碰巧猜对"能覆盖的范围。发音、词汇、语法、语义、语用,每一层都有巨大的可能性空间,而他唯一的信号来源是一个比特的"对/错"。

这就是传统强化学习面对开放世界时的真实处境。一道数学题,模型生成几千个token的推理过程,最后只得到一个"对"或"错"。几千个token的努力,换回大约一个比特的信息。用这么稀薄的信号从零开始学习"巴黎是法国首都""Python的for循环怎么写""光合作用的原理",是不可能的。知识是高带宽的信息,必须从大量数据中学习,一面锣承载不了这个量级的信息。

所以传统强化学习的真正瓶颈不是"世界太大"或"计算量不够",而是"信号太穷"。用一面锣从零教会一个人所有的知识和技能,这件事在原理上就走不通。

理解了这一点,才能理解大模型上的强化学习为什么是完全不同的一件事。

二、锣还是那面锣,但人已经不一样了

大模型上的强化学习,算法框架跟传统RL相似,奖励信号同样稀薄,同样是"做对了加分做错了扣分"。那它为什么能成功?

区别只有一个,但这个区别改变了一切:它不是从零开始的。

在做RL之前,模型已经经过了预训练。几万亿个token的书籍、网页、论文、代码,通过"预测下一个token"这个简单而强大的目标,被压缩进了几千亿个参数里。

预训练的监督信号跟RL截然不同。它是极其稠密的:每一个token位置都有标准答案(下一个真实的token),每一个位置都产生梯度。这不是敲锣,这是手把手、逐字逐句地示范。这就是为什么预训练能灌进去海量的世界知识和语言能力,而RL不能。

预训练结束后的模型是什么状态呢?

打个比方,它像一个读过世界上所有书的人。他什么都知道一点,见识非常广,但做事不太靠谱。你让他做一道数学题,他可能洋洋洒洒写了一大段推导,中间夹杂着正确的思路和离谱的跳步,最后答案可能对也可能错。如果你让他做十次同一道题,可能三次对七次错。正确的方法他是"知道"的,但他同样知道很多不正确的方法,而且分不太清什么时候该用哪个。

强化学习在这个基础上做的事情就清楚了:让他做大量的题,做对了的方式加强,做错了的方式抑制。一轮一轮下来,模型不是学到了新知识,而是学会了更稳定地调用自己已有的知识。

回到之前的比方:传统RL是拿着一面锣,对一个完全不懂中文的人从零教学。大模型RL是拿着同一面锣,对一个已经读完了所有中文书但说话还不太利索的人做校准。

锣还是那面锣,信号还是那么稀薄。但后者的起点完全不同,稀薄的信号已经足够帮他校准那些他"差不多会"的东西了。

这就是为什么同样叫强化学习,传统的只能做专用智能,大模型上的能提升通用能力。差异不在算法,在起点。

三、那根拴住模型的橡皮筋

但这里有一个自然的疑问。

RL不断地调整模型参数,把某些行为的概率调高、某些调低。预训练辛辛苦苦灌进去的通用能力,会不会在这个过程中被破坏?

这不是理论上的担忧,而是真实发生过的事。DeepSeek做过一个实验版本叫R1-Zero,纯用RL训练,不加任何保护措施。结果模型确实学会了做数学题,正确率提高了。但推理过程变得中英文混杂、语句不通顺、可读性很差。答案是对的,但说的不是人话了。

为什么会这样?

因为RL的目标函数里只有奖励,完全不关心"输出是不是通顺的人话"。预训练时模型之所以说人话,是因为训练目标就是模仿人类文本。RL阶段这个目标被换掉了,梯度只朝奖励高的方向推。只要某种不说人话的输出恰好能拿到同样的奖励,优化过程就没有任何理由维持语言质量。不是模型"忘了"怎么说人话,而是RL根本不在乎它说不说人话。

所以实践中,大模型RL有一个几乎不可或缺的约束机制,叫KL散度惩罚。这个名字听起来很学术,但背后的想法其实很直觉。

KL散度是信息论里衡量两个概率分布差异的一个量。两个分布完全一样时,KL散度为零;差得越远,数值越大。你可以把它简单理解为"两个分布之间的距离"。

具体做法是这样的。RL训练开始前,把当前模型(预训练加上初步微调后的版本)拍一张快照,冻结起来,称为参考模型。这个参考模型在整个RL训练过程中不变,像一个锚点。

然后RL训练时,模型的优化目标不再是单纯的"最大化奖励",而是同时受两股力的拉扯。一股力朝奖励高的方向推,另一股力把模型往参考模型的方向拉。后者就是KL惩罚:当前模型在某个输入上的输出分布和参考模型差得越远,罚得越重。

可以想象成一根橡皮筋,一头拴在原始模型上。RL可以把模型朝奖励高的方向拉,但走得越远,橡皮筋的回拉力就越大。走太远的时候,回拉力会超过奖励的吸引力,模型就被拉回来了。

这形成了一个动态平衡:模型在奖励信号的引导下改善行为,但又不会跑偏到丢失原有的语言能力和通用知识。R1-Zero出现的那种"答案对但不说人话"的现象,就是因为没有这根橡皮筋。在正常的生产级RL训练中,KL约束是标配,它保证了模型在变强的同时还记得"说人话"。

这个约束还有一个不太直觉但很重要的附带好处:防止模型钻漏洞。

任何奖励函数或验证器都不可能完美。不加约束的话,模型可能发现一些匪夷所思的方式来骗取高分,比如输出一段乱码恰好通过验证器的格式检查,或者无限重复某句话来刷高某个评分指标。这类"作弊方式"的共同特点是:在正常的语言模型看来,它们的概率极低。正常说话的人不会输出乱码,也不会病态地重复同一句话。所以KL惩罚对这类行为的打击特别重,因为它们偏离参考模型的分布太远了。

当然,KL约束不是万能的。如果某种作弊方式恰好长得像正常语言,比如一段听起来头头是道但逻辑其实有问题的推理,KL惩罚就识别不出来。所以实践中防作弊是组合拳,KL只是其中一层。但它至少挡住了最粗暴的退化模式,让RL训练能在一个合理的范围内运行。

四、真正被强化的是什么

理解了大模型RL的运作方式之后,有一个更深层的问题值得细想。

现在主流的RL训练,主要在数学和代码这两类任务上进行。选择它们的原因很实际:数学题要么对要么错,代码跑不跑得过测试一目了然,这给RL提供了干净的、不需要人工介入的奖励信号。

但一个值得玩味的现象是,在数学和代码上做完RL训练的模型,其他能力也跟着提升了。写分析报告更有条理了,做长程规划更合理了,在完全不相关的领域也表现出了更好的判断力。

这就很奇怪了。如果RL只是在数学领域强化了模型,那提升应该局限在数学领域才对。为什么会出现这种广谱的溢出效应?

要回答这个问题,需要仔细想一想模型在数学RL中到底学到了什么。

不是数学知识。勾股定理、微积分的规则、概率论的公式,这些在预训练阶段就已经进入模型了。RL没有给模型提供任何新的数学教材。

那是什么?

是一套思考的流程。

没训练过RL的模型做数学题,倾向于一口气写下去,想到哪写到哪,中间可能跳步,可能走入死胡同也不自知,写完就交卷不检查。RL训练之后,模型的行为模式变了:它会在动手之前先规划思路,把大问题拆解成小步骤,关键步骤做完后回头验算一遍,发现矛盾会停下来重新检查假设,不确定的地方会尝试多条路径再比较。

这些不是数学知识,而是认知科学里所说的元认知:关于"如何思考"的思考。

元认知有一个核心特征:它天然是跨领域的。"做完验算一遍"这个习惯,在数学题上是检查计算,在写代码时是跑测试,在做商业分析时是检查假设是否成立,在写文章时是通读一遍看逻辑通不通。底层是同一套思维操作,只是应用在不同的材料上。

所以答案就清楚了。强化学习在大模型上真正强化的,不是某个领域的具体技能,而是一种做事的元能力。正因为被强化的东西本身就是通用的,训练虽然在窄领域进行,收益却是广谱的。

这也解释了一个直觉上不太好理解的现象:为什么各家模型都不约而同地选择在数学和代码上做RL。不只是因为这两个领域容易验证对错,更是因为这两个领域对元认知的要求特别高。数学要求你严谨、不跳步、会验证。编程要求你分解问题、调试错误、处理边界条件。在这些任务上磨出来的思维习惯,恰好是在任何领域都有用的"高迁移技能"。

用一句话概括:预训练教的是"知道什么",RL教的是"怎么想"。

五、为什么是现在

既然强化学习这么有用,为什么不早用?

其实一直在用。从2022年底的ChatGPT开始,大模型就用RLHF(基于人类反馈的强化学习)来做对齐,让回答更有礼貌、更安全、格式更好看。但那个阶段的RL更像是在做"包装",主要是调整风格和安全性,不太涨硬能力。

转折点是从"人类打分"换成了"客观验证"。

RLHF依赖人类评委打分,这有很多问题:主观、昂贵、速度慢,而且模型会学会讨好评委而不是真正变强(说得好听、显得自信、回答很长,分数就高了)。用可验证奖励做RL则不同,数学题对就是对、错就是错,代码通过测试就是通过、没通过就是没通过,模型讨好不了一个数学定理。

这条路线在2024年底由OpenAI的o1模型走通,2025年初DeepSeek的R1开源了具体方法,全行业快速跟进。

但跑通路线只是起点。真正把RL潜力榨干,需要大量基础设施建设。要有自动生成海量不同难度任务的系统,要有让模型在真实软件环境里操作的沙箱,要有严格判定任务成败且不被模型钻空子的验证器。这些工程上的脏活累活需要时间搭建,现在刚好进入了收获期。

还有一个容易被忽略的因素:RL和预训练是相乘的关系,而不是相加。底座模型越强,模型随机采样十几次中出现正确答案的概率就越高,RL能筛选出来的好行为就越多。当底座规模扩大和RL训练同时推进时,效果是复合增长的。

之前觉得"到头了",其实是只看到了预训练单条曲线的减速。RL是第二条曲线,它的陡峭上升段恰好接上了预训练的放缓段。两件事叠在一起,就造成了"以为到头了却突然猛涨"的观感。

不是天花板被捅穿了,而是有人在天花板旁边找到了一部新的电梯。

六、一个开放的问题

最后聊一个稍微跳出技术的话题。

如果大模型RL真正强化的是元认知,那人类能不能也专门训练元认知?

有意思的是,这种尝试早就存在了,只是没有用"元认知训练"这个名字。数学教育中波利亚的《怎样解题》就是一本纯元认知教材,它不教任何具体的数学知识,只教你"拿到一道题以后应该怎么想":理解题意、制定计划、执行计划、回顾检查。教育心理学里也有大量研究表明,直接教授元认知策略是有效的:教学生"做完检查一遍""把问题换个说法复述""卡住了就回到已知条件",确实能提高成绩。

但人类有一个跟模型很不一样的限制:远迁移非常难。

在数学课上练出来的验算习惯,很难自动变成写论文时的自我检查习惯。各种"大脑训练"软件号称能提升通用思维能力,但跨领域迁移效果在研究中普遍不理想。人在一个领域养成的好习惯,换一个领域往往需要从头建立。

而大模型的元认知迁移似乎比人类容易得多。数学题上练出来的严谨,真的会自发出现在写代码、做分析、甚至创意写作中。

为什么会有这种差异?也许原因在于一个根本的结构不同。大模型的所有能力共用一套参数,改变"思考习惯"的参数调整会通过共享权重自动扩散到所有场景。而人类大脑有更强的模块化倾向,不同技能依赖部分独立的神经回路,跨模块的迁移需要额外的、有意识的练习。

这引出了一个有趣的可能性。也许未来的教育可以从大模型RL的经验中获得一些启发。不是照搬算法,而是借鉴那个核心洞察:与其不断地往学生脑子里灌更多的知识,不如花更多时间训练思考的方式本身。

当然,人和模型毕竟是不同的存在,直接类比有其限度。但至少有一点是清楚的:这一轮大模型的能力飞跃,本质上不是"知道更多",而是"想得更好"。

预训练给了模型一个博学但毛躁的大脑,强化学习把它训练成了一个既博学又靠谱的大脑。

而这个训练过程才刚刚开始。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。

如果你也在自己跑模型、写代码、做项目

或者使用ClaudeClaude code

欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。

上一篇训练大模型太贵了,能不能用小模型"猜"出大模型的参数?下一篇大模型天生就会投机取巧