龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

GPT-5.6 有三个模型,小的那个是大的"缩小版"吗?

格里灰丝2026-07-12约 5106 字Markdown 原文

最近 OpenAI 发布了 GPT-5.6,一次性推出了三个模型:Sol(旗舰)、Terra(均衡)、Luna(轻量)。很快就有人说:"Luna 是 Sol 后训练出来的",或者"Luna 是 Sol 蒸馏出来的缩小版"。

这两种说法听起来都挺合理,但仔细一想就有问题了。后训练不改变模型的骨架大小,一个大模型怎么可能通过后训练"变成"一个小模型?而蒸馏虽然确实涉及大模型和小模型,但它的实际过程跟"缩小"完全是两回事。

这个问题一旦较真,你会发现它牵出了一连串更本质的问题:大模型家族里的"大"和"小"到底是什么意思?小模型从哪来?一个模型的能力到底由什么决定?以及,为什么训练大模型要分成"预训练"和"后训练"两步?

这篇文章就从这些常见误解出发,把这些问题一个一个拆开讲清楚。

· · ·

一、同一个家族,不同的"骨架"

首先要澄清一个认知:Sol、Terra、Luna 不是同一个模型的三种设置,而是三个不同大小的模型。

把模型想象成一栋楼。每栋楼有很多层,每层里面有一些"房间"(神经元),房间之间有"走廊"相连(连接权重)。网络结构就是这栋楼的建筑图纸:总共几层、每层多宽、房间之间怎么连。参数量就是所有走廊的总数。

Sol 可能是一栋 100 层的大楼,Luna 可能只有 30 层。虽然建筑风格可能类似(都是 Transformer 架构),但规模完全不同。图纸一旦定了、楼一旦盖好,走廊的数量就是固定的。后训练只是重新粉刷墙面、调整房间里的家具摆放,不可能把一栋 100 层的楼变成 30 层。

那为什么它们都叫 5.6?

因为"代际编号"代表的不是同一个基座模型,而是同一代技术方案。5.6 意味着这三个模型大体共享同一代的技术方案和数据管线,但各自有独立设计的网络结构,各自经历了自己的训练过程。实际上不同大小的模型在训练时经常会有各自的数据配比和训练策略,小模型往往按更高的数据量与参数量之比来训练,所以"共享技术方案"是大方向上的,细节未必相同。

这就像丰田第八代凯美瑞有 2.0L 和 2.5L 两个版本,共用同一代平台架构和设计理念,但发动机的尺寸和调校并不一样。"代"指的是技术世代,不是"同一个引擎的不同版本"。

OpenAI 自己的说法也印证了这一点:他们说编号代表模型的世代,Sol、Terra、Luna 是"可以按各自节奏演进的持久能力档位"。也就是说,未来完全可能单独出一个 GPT-5.7 Luna,而 Sol 还停在 5.6。它们是独立的产品线,不是一个大模型的三种衍生品。

· · ·

二、小模型到底是怎么来的?

既然 Luna 不是 Sol "变小"的,那它是怎么来的?目前 OpenAI 没有公开具体的技术路线,但业界常见的做法大致有三条路径。

第一条:从头独立训练。 直接设计一个小的网络结构,用同一套训练数据从零开始预训练。这是最直接的方式,出来的模型和大模型之间没有参数上的继承关系,只共享训练数据和方法论。

第二条:蒸馏。 这是最容易被误解的一条路。很多人听到"Sol 蒸馏出了 Luna",就以为是把 Sol 的参数压缩变形成了 Luna。但蒸馏的实际过程不是这样的。

最常见的一种蒸馏(黑盒蒸馏)是这样做的:Sol 作为"教师",针对各种问题生成高质量的回答、推理示范和评分数据;然后用这些数据去训练一个预先设计好的小模型 Luna。整个过程中,被更新权重的始终是 Luna 自己,Sol 只是提供了训练素材。教师给的是"教材",不是"身体"。

还有一种更精细的蒸馏(白盒蒸馏),学生不只是学教师的最终答案,而是直接去模仿教师对每个 token 输出的概率分布,甚至模仿教师中间层的内部表示。这相当于教材从"参考答案"升级成了"完整的解题思路和每一步的思考过程"。Gemma 2 就是用这种方式训练的。但不管哪种蒸馏,核心结论不变:被更新权重的始终是学生模型,教师只提供了不同精细度的"教材"。

第三条:从大模型剪枝后继续训练。 这条路包括多种具体做法。一种是在深度方向上做减法,比如从 Sol 的 100 层中选出若干层的权重,作为 Luna 对应层的初始值,然后在这个基础上继续训练。选层时通常会先评估每一层的重要性再决定去留,因为研究发现各层的冗余程度并不均匀,靠前的层和最后几层通常更关键,冗余往往集中在中后段。另一种是在宽度方向上做减法,减少每一层的隐藏维度、砍掉部分注意力头、收窄前馈网络,代表做法有 NVIDIA 的 Minitron 和 Sheared LLaMA。实践中经常是深度和宽度一起剪,剪完再用蒸馏或大规模训练来恢复性能。

这条路能走通,是因为研究发现大模型内部存在相当的冗余,删掉一些层或砍窄一些维度后,模型的输出变化并不一定很大。但剪枝之后模型的能力一定会下降,需要大量继续训练来修复。

现实中,Luna 很可能是这三条路径的某种组合。但不管走哪条路,有一个核心结论不变:Luna 有自己独立设计的、更小的网络结构图纸,这张图纸决定了它的参数规模和能力天花板。Sol 可以给 Luna 提供教材,甚至借它几车砖瓦当起点,但 Luna 这栋楼的图纸从一开始就是独立画的,每一面墙最终都要自己砌。

· · ·

三、什么决定了一个模型的能力?

理解了小模型的来源之后,自然会问:那到底什么决定了一个模型最终有多强?

答案涉及三个因素,按影响的深度排列。

第一层:基座(网络结构 + 预训练)。 这是最根本的。网络结构决定了模型的"大脑容量",有多少参数、能存多少知识、能做多深的推理。预训练决定了这个大脑里实际装了多少东西,语言规律、世界知识、逻辑模式,都是在预训练阶段通过阅读海量文本学到的。

基座定的是天花板。一个 30 层的小模型,不管后面怎么训练,都不可能装下 100 层大模型所能容纳的全部知识和推理能力。

第二层:后训练(SFT、RLHF 等)。 后训练决定的是模型能发挥出多少已有能力。一个预训练很好的模型,如果不做后训练,就像一个读了整个图书馆的学者,你问他问题,他可能会给你续写一篇论文、可能重复你的话、可能不知所云。因为他从来没被教过"当别人问你问题的时候,你应该给出一个有用的回答"。

后训练就是那个岗位培训:教模型理解指令、按格式回答、拒绝有害请求、组织推理步骤。同一个基座经过不同的后训练,实际体验可能天差地别。

不过需要指出的是,"预训练定天花板"这个说法的边界正在变得模糊。近两年推理模型(比如 OpenAI 的 o 系列、DeepSeek 的 R1)的出现,让后训练阶段的强化学习分量大幅上升。这类训练能显著提升模型在数学和代码等领域的表现,学界目前还在争论:这到底是强化学习"激发了基座已有的潜力",还是它真的能"创造出基座本身不具备的新能力"。无论争论结果如何,后训练的分量比几年前要重得多,这是事实。

第三层:教师模型(蒸馏中的大模型)。 如果小模型的训练数据来自一个更强的大模型,教师的质量会直接影响小模型的最终表现。在特定任务上,好的教师数据甚至比增加参数量效果更明显。

这三层的关系可以用一个比方来理解:基座像一个人的大脑硬件和基础教育(从小到大的十几年积累),后训练像入职后的岗位培训(从几个月到越来越长),教师模型像培训时用的教材质量。大脑小、基础教育差,再好的培训和教材也有上限。大脑大、基础好,但培训拉跨,就会"有知识但不会用"。教材质量高,能让同样底子的人发挥得更好,但教材替代不了底子。

有一个细节特别能说明这个逻辑:如果后训练真能抹平基座的差异,OpenAI 就没必要把 GPT-5.6 分成三个档位、定三种价格了。Luna 定价是 Sol 的五分之一,对应的就是更小的模型、更低的推理成本,以及在复杂任务上必然存在的能力差距。

· · ·

四、后训练为什么不能替代预训练?

很多人会有一个直觉:既然后训练能让模型变得更好,那多做一些后训练,是不是就能弥补预训练的不足?

至少目前来看,不能。原因在于两者的性质和侧重不同。

预训练阶段,模型要吃掉几万亿甚至十几万亿个 token 的文本。这个量有多大?按一本书大约 10 万 token 估算,十万亿 token 相当于上亿本书,一个人不吃不睡地读也要几万年。模型在这个过程中学到的是非常深层的东西:语言的语法结构、物理世界的常识、不同领域的概念关系、逻辑推理的基本模式。这些知识分散沉淀在所有参数里。

后训练阶段,人工标注的数据量通常只有预训练的千分之一甚至万分之一。几十万到几百万条精标注的指令和偏好数据。虽然近年来强化学习阶段模型自己生成的数据量可以很大,但人工监督信号的密度仍然远不及预训练。后训练更多教的是行为模式(怎么回答、什么时候拒绝、怎么组织推理步骤),而不是底层知识(什么是量子力学、英语语法怎么运作)。

回到那个比方:预训练是一个人从小到大十几年的教育和阅读积累,后训练是入职后的岗位培训。岗位培训能教你写报告、跟客户沟通、遵守规范,但不可能替代你十几年的基础知识积累。如果一个人连基本的数学和逻辑都没学过,再好的岗位培训也没法让他做数据分析。

所以目前更准确的关系仍然是:预训练定天花板,后训练定你能接近天花板多少。 不同模型的天花板不一样,收敛的终点也就不一样。当然,随着强化学习技术的发展,"天花板"本身能被后训练推高多少,是一个正在被重新审视的问题。

· · ·

五、为什么要分两步走?

最后一个问题:这种"先预训练再后训练"的两阶段做法,到底为什么有效?

其实它不是从理论上推导出来的"唯一正解",而是实践中摸索出来的目前效果最好的工程方案。它之所以有效,背后的逻辑可以这样理解:

预训练需要的数据量极大,这种量级只能从互联网上大规模采集,不可能人工标注每一条数据。但互联网上的原始文本是杂乱的,模型只是从中学会了"语言是怎么回事"和"世界大致是怎样的",并没有学会"怎么当一个有用的助手"。

后训练需要的是高质量的、人工精标注的数据,教模型怎么理解指令、怎么组织回答、什么该说什么不该说。这种数据极其昂贵,不可能做到万亿级别。

所以两阶段的分工是:第一步用廉价的、海量的、无标注的数据把知识和语言能力灌进去;第二步用昂贵的、少量的、精标注的数据把行为模式调教好。一个解决"知道什么",一个解决"怎么表现"。

这跟人学东西有相似之处。人也是先通过大量的无监督经验(听别人说话、观察世界、大量阅读)形成对世界的基本理解,然后通过有针对性的训练(学校教育、职业训练、师傅带徒弟)学会特定技能和行为规范。没人能跳过前面十几年的成长,直接从零开始做专业训练。

但也有本质不同:人的学习是连续的、终身的,两个阶段没有明确的分界线。大模型的两阶段在设计上是分开的,但实际操作中这条线也在变模糊。比如预训练后期的退火阶段就已经会掺入高质量的指令数据,持续预训练也越来越常见。而且人可以从极少的例子中学会新概念,大模型在这方面还远不如人。

那未来有没有可能不分两步?有可能。现在已经有团队在尝试把两个阶段融合,或者用合成数据和自我博弈来替代传统的预训练。但到目前为止,还没有哪种方法真正取代了"大规模预训练 + 后训练"这个范式。

这意味着:我们现在看到的所有大模型,包括 GPT-5.6、Claude、Gemini,它们的训练方式并不是某种"终极真理",而是特定技术条件下的最优解。理解这一点,才不会把当下的做法当成唯一可能的路径,也才能更好地理解未来这个领域的每一次范式变化。

· · ·

写在最后

回到开头的那个问题:"Luna 是 Sol 后训练出来的吗?"

现在你知道了,这句话最合理的解读是:Sol 作为教师参与了 Luna 的训练过程,给它提供了高质量的训练数据和监督信号。但 Luna 有自己独立设计的、更小的网络结构。Sol 可以给它教材,甚至借它几车砖瓦当起点,但 Luna 这栋楼的图纸从一开始就是独立画的,每一面墙最终都要自己砌。

理解这一点之后,你再看任何大模型家族的"大中小"分档,就不会简单地以为小模型是大模型的压缩版了。它们之间的关系,比"缩小版"要复杂得多,也有趣得多。


我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。

上一篇别听他们瞎扯,Anthropic可从来没说Claude有意识了下一篇从底层原理开始,把Git彻底讲明白