# 既然模型越大越强，为什么不直接做一个50万亿参数的模型？

> 龙虾AGI通用实验室 · 2026-07-25

· · ·

Kimi K3，2.8万亿参数。Fable 5，被公认为当前最强的通用AI模型。行业里所有人都同意一件事：模型越大，效果越好。

那一个自然的问题就出现了。既然大就是好，你们为什么不一步到位？为什么要从1万亿慢慢做到3万亿，就不能直接做个50万亿的？

很多人会给出一个简单的答案：没钱，买不起那么多GPU。

这个答案不能算错，但它只说了十分之一的真相。真正的答案要有趣得多，也残酷得多。

## 算力是最硬的天花板，之一

先说算力这个最直观的约束。

训练一个2.8万亿参数的模型（比如Kimi K3），需要的GPU集群规模已经极其庞大了。如果你要直接跳到30万亿甚至50万亿，需要的算力不是线性增长的。目前前沿模型的训练成本已经到了数十亿美元级别。一个50万亿的稠密模型可能需要数万张顶级GPU跑几个月，光是电费和硬件折旧就是天文数字。

但关键问题不在这里。关键问题在于，全球高端AI芯片的产能是有限的。英伟达的GB300、华为的昇腾950，这些顶级芯片不是有钱就能立刻买到的。产能就那么多，全世界的AI公司都在抢。有人在一次投资人交流会上说了一句很实在的话："如果能半年之内把钱花完，那是最好的，实际上做不到。"不是不想花，是买不到那么多卡。

所以算力确实是天花板。但这还不是最有趣的部分。

真正有趣的是：就算你真的搞到了足够多的GPU，你也不敢直接训一个50万亿参数的模型。原因在于，"训练"这件事远没有大多数人想象的那么简单。

## 你以为的训练 vs 真正的训练

大多数人想象中的大模型训练是这样的：把数据准备好，把模型架构搭好，然后在一堆GPU上点击"开始"，等几周就出来一个模型了。就像烤蛋糕，搅拌原料，放进烤箱，定好时间，坐等出炉。

实际上，"按下开始键"那一刻只是整件事的最后一步。前面的所有工作，才是真正要花时间和算力的地方。

某人在交流会上有一句话，精确地点出了这个问题的核心："你要硬要训那么大模型也是能训，但是你没法做充分的研究。就是你在训之前，没法做充分的研究。"

注意，他说的不是"做不到"，而是"做得到但不敢做"。

为什么不敢？因为在正式训练之前，你至少需要完成五件事。

**第一件事是选架构。** 用稠密模型还是混合专家（MoE）？注意力机制怎么设计？层数多少？隐藏维度多大？每一种选择都会影响最终效果。这些选择没有标准答案，必须通过实验来比较。怎么实验？训练一批几十亿参数的小模型，每个只改变一个变量，然后看谁的表现最好。

**第二件事是摸规律。** 你需要搞清楚，模型从100亿参数扩大到1000亿参数，性能会提升多少？需要多少数据？这条曲线是什么形状的？这叫Scaling Law，缩放定律。你必须先在小规模上把这条曲线画出来，才能预测大规模模型的表现。否则你就是闭着眼睛往前冲。

**第三件事是配数据。** 代码、数学、英文网页、中文文本、科学论文，这些不同类型的数据按什么比例混合，直接决定模型在不同任务上的表现。代码多了，编程能力强但闲聊变弱。英文占比太高，中文就拉胯。最佳配比是什么？不知道，只能一遍一遍试。

**第四件事是调超参数。** 学习率多大？变化策略用哪种？预热阶段跑多长？这些超参数的最优值会随模型规模变化。在100亿参数模型上完美的方案，到了1万亿可能让训练直接崩掉。所以每次扩大规模，都需要重新调一遍。

**第五件事是跑稳定性测试。** 这个最关键，也最容易被低估。下一节展开讲。

以上五件事，每一件都需要真实地训练一批模型。不是纸上谈兵，必须用GPU去跑。而跑这些实验消耗的总算力，往往比最终的正式训练还要多。

## 训练稳定性：大模型的头号噩梦

如果说算力是"有没有资格参赛"的门槛，那训练稳定性就是"参赛之后能不能跑到终点"的核心考验。

模型越大，训练过程中出问题的概率越高。这不是一种模糊的感觉，而是有具体的技术原因。

先说梯度爆炸。神经网络训练时，误差信号需要从输出层一层一层往回传播，每经过一层就要乘一次该层的导数。如果这些导数倾向于大于1，经过几百层甚至上千层之后就会指数级放大。1.01的1000次方是多少？大约是21916。一个微小的倾向，经过足够多的层数积累，就变成了灾难。

你可能会说，这个问题不是有解法吗？梯度裁剪（gradient clipping）就是干这个的，当梯度超过某个阈值就把它截断。没错，这个方法确实能防止数值上的崩溃。但问题是，裁剪是一种粗暴的补救。被剪掉的梯度信息是真实丢失的，模型在那一步的学习就不完整了。小模型偶尔裁剪一次无所谓，但大模型因为层数多、参数多，触发裁剪的频率远高于小模型。频繁裁剪累积起来，会实质性地影响训练质量。而且裁剪的阈值本身也需要精心调节，在不同规模的模型上最优值可能完全不同。

所以"有解法"和"完美解决了"之间的距离，可能比你想象的要大得多。

再说一个更具体的案例。现代大模型都用"残差连接"来让信号在网络中顺畅传递，你可以理解为信号传输的高速公路。后来有研究者想把这条高速公路拓宽，让每一层能传递更多信息，这叫Hyper-Connections。听起来是个好主意。

但DS的研究团队发现，拓宽之后如果不加额外约束，信号每经过一层都会被略微放大。一层放大一点点不要紧。但经过几千层之后呢？放大效应是乘法累积的。他们实测发现，信号的增益幅度可以飙到原始值的3000倍。

3000倍意味着模型后面几层接收到的数值已经完全失控了。就像你把音响音量开到3000倍，不是声音更大了，是音响直接炸了。

最关键的一点是：这个问题在几百层的小模型上几乎看不出来。因为管道短，信号还没来得及累积放大到爆炸。只有当模型深到几千层，放大效应才会突然越过临界点。你在小规模实验中得出"这个架构没问题"的结论，放大十倍之后可能完全不成立。

还有"损失突刺"（loss spike）这个噩梦。训练过程中，损失值本来在平稳下降，突然毫无预兆地飙升一大截。原因可能是遇到了一批异常数据，也可能是优化器在参数空间的某个"悬崖"边缘滑了一跤。小模型也会遇到，但大模型因为训练时间极长、数据量极大，遇到的概率更高，每次突刺的后果也更严重。有时候模型能自己恢复过来，有时候恢复不了，性能永久性地下降了一截。如果在正式训练跑到60%的时候来一次无法恢复的突刺，前面几个月的算力投入就全打了水漂。

还有一种容易被忽视的不稳定因素：硬件故障。训练一个超大模型需要几万张GPU同时工作。这些GPU分布在大量物理服务器上，通过高速网络连接。每一台服务器、每一块GPU卡、每一条网络线缆都有一定的故障概率。8张GPU跑几周，一张卡都不坏很正常。但50000张GPU跑三个月，从概率上看，几乎可以保证期间会有硬件故障。任何一个节点（也就是一台服务器或一块GPU卡）出问题，都可能中断整个分布式训练，需要从最近的检查点恢复。集群越大，你花在"处理故障、恢复训练"上的时间占比越高，有效训练的效率越低。

所有这些不稳定因素叠加在一起，构成了一个核心矛盾：模型越大，你越需要确保训练方案万无一失。但万无一失只能通过一步步的实验来验证，而每一步实验本身就要消耗大量算力。

## 为什么不能跳级，以及最佳步幅是多少

到这里，为什么不能一步到位已经很清楚了。很多问题只有在特定规模上才会冒出来，你在小规模上根本遇不到。2万亿参数级别暴露的工程问题，可能在1万亿时根本没出现过。

那么一个自然的追问是：每次应该扩大多少？有没有一个最佳的增长倍数？

没有一个固定公式，但业界的经验大致是每次扩大3到10倍。

从历史来看，GPT系列的参数增长大致是：GPT-2约15亿，GPT-3约1750亿，跳了大约100倍。但GPT-3到GPT-4的跳跃就不再是单纯堆参数了，而是引入了MoE架构。Llama系列是7B、13B、70B这样的梯度，每步大约2到5倍。DS自己也是从几B到几十B再往上走。

关键不在于倍数本身，而在于你每一步都要有足够的实验来验证方案。如果你在100亿参数上做了充分的架构搜索和缩放定律拟合，你预测500亿的表现是比较靠谱的。但如果你直接从100亿跳到5万亿，跨了500倍，你的预测就极不可靠了。因为通信瓶颈、内存管理、训练稳定性这些工程问题，可能在中间某个规模突然冒出来，而你完全没有应对经验。

所以不是有一个神奇的倍数告诉你该跳多远，而是你的实验验证能力决定了你能安全跳多远。算力越多，能做的中间实验越多，就能跳得更远。算力少的时候只能小步走，这也正是中国公司面对的现实。

某人在交流会上直接亮了家底："我们现在的资源，也只足够我们在十B激活的这个规模里面去做更多的实验。"而美国最大的模型已经做到了800B激活，差了将近两个数量级。这意味着DS必须在10B规模上把方案吃透，然后小心翼翼地推到几十B，几十B吃透再推到一百多B。每一步都不敢跳太远。

## 数据：另一堵正在逼近的墙

算力和训练稳定性之外，还有一个约束正在快速逼近，而且可能比前两者更加根本：高质量训练数据正在枯竭。

预训练数据不是越多越好。首先你得筛选。互联网上大量的垃圾网页、SEO注水内容、机器翻译的低质量文本、广告、恶意内容，这些混进训练数据只会拉低模型质量。所以数据处理本身就是一条完整的流水线：语言识别、质量打分、去重、有害内容过滤、领域分类，每一步都需要精心设计。

筛完之后能用的高质量数据有多少？Epoch AI的研究预测，按照当前的消耗速度，公开可用的高质量人类文本会在2026到2032年间被耗尽。

更麻烦的是，AI自己正在加速这个问题。互联网上的AI生成内容占比在快速增长，博客、新闻稿、社交媒体评论，越来越多出自AI之手。下一代模型的训练数据从互联网上抓取时，会不可避免地吃进这些AI生成的文本。研究表明，当AI反复学习自己的输出时，会发生"模型坍缩"：每一代都丢失一点分布尾部的信息，几代之后输出变得越来越单调，越来越趋向平均值。

这个问题在我们后续的文章中会专门展开讨论。这里只想指出一点：即使算力和工程问题全部解决，数据可能是大模型扩张遇到的最终瓶颈。做一个50万亿参数的模型，你拿什么数据去喂它？

## 真正的竞赛发生在水面之下

回到最初的问题。既然模型越大越强，为什么不直接做一个50万亿参数的？

因为大模型竞赛的本质从来不是比谁的参数多。参数量只是一个结果，是研究能力和工程能力的外在体现。

真正的竞争发生在水面之下：谁能在更大的规模上做更可靠的预研实验，谁积累了更多只有在特定规模下才能获得的工程经验，谁的架构创新能让同等参数量发挥出更大的效能。

这有点像问"既然楼越高住的人越多，为什么不直接盖一万层的大楼"。答案不是缺砖头，而是你还没有掌握在那个高度上让大楼不倒的工程知识。砖头可以买，钢筋可以买，但"盖两百层楼不翻车的经验"只能从盖过一百层开始积累。

中美AI差距常常被简化为"芯片禁运"的叙事。这个叙事不能说错，但它只是冰山一角。即使明天所有芯片禁令全部取消，"研究经验"这种东西仍然需要时间来积累。你不可能跳过2万亿参数直接去做20万亿，正如你不能跳过盖10层楼的经验直接去盖200层。那些在2万亿规模上才会出现的问题，你在1万亿时根本想象不到。

某人给自己设定的目标很克制："用美国几分之一的算力，把时间差距从12到18个月缩短到6个月、3个月。"他没有说超越。他说的是缩短差距，而且给出了一个具体的、有限的数字。

这种克制本身就是一种清醒。在一场比的是"谁踩过更多坑"的竞赛中，唯一的加速方式就是在每一步里提取更多的信息、犯更少的错、以更高的效率完成前置研究。

所以当你看到某家公司发布了一个3万亿参数的模型时，真正值得关注的不是"3万亿"这个数字本身，而是它背后意味着什么：这家公司已经踩过了从1万亿到3万亿之间所有的坑，积累了在那个规模上训练的全部经验。

这些经验才是真正的壁垒。不是算力，不是资金，不是论文数量。是你在黑暗中一步步摸索出来的路。

而这条路，只能自己走。

· · ·

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，或者使用Claude和Claude code，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/1762e1/img_001.jpg)
