· · ·
Kimi K3,2.8万亿参数。Fable 5,被公认为当前最强的通用AI模型。行业里所有人都同意一件事:模型越大,效果越好。
那一个自然的问题就出现了。既然大就是好,你们为什么不一步到位?为什么要从1万亿慢慢做到3万亿,就不能直接做个50万亿的?
很多人会给出一个简单的答案:没钱,买不起那么多GPU。
这个答案不能算错,但它只说了十分之一的真相。真正的答案要有趣得多,也残酷得多。
算力是最硬的天花板,之一
先说算力这个最直观的约束。
训练一个2.8万亿参数的模型(比如Kimi K3),需要的GPU集群规模已经极其庞大了。如果你要直接跳到30万亿甚至50万亿,需要的算力不是线性增长的。目前前沿模型的训练成本已经到了数十亿美元级别。一个50万亿的稠密模型可能需要数万张顶级GPU跑几个月,光是电费和硬件折旧就是天文数字。
但关键问题不在这里。关键问题在于,全球高端AI芯片的产能是有限的。英伟达的GB300、华为的昇腾950,这些顶级芯片不是有钱就能立刻买到的。产能就那么多,全世界的AI公司都在抢。有人在一次投资人交流会上说了一句很实在的话:"如果能半年之内把钱花完,那是最好的,实际上做不到。"不是不想花,是买不到那么多卡。
所以算力确实是天花板。但这还不是最有趣的部分。
真正有趣的是:就算你真的搞到了足够多的GPU,你也不敢直接训一个50万亿参数的模型。原因在于,"训练"这件事远没有大多数人想象的那么简单。
你以为的训练 vs 真正的训练
大多数人想象中的大模型训练是这样的:把数据准备好,把模型架构搭好,然后在一堆GPU上点击"开始",等几周就出来一个模型了。就像烤蛋糕,搅拌原料,放进烤箱,定好时间,坐等出炉。
实际上,"按下开始键"那一刻只是整件事的最后一步。前面的所有工作,才是真正要花时间和算力的地方。
某人在交流会上有一句话,精确地点出了这个问题的核心:"你要硬要训那么大模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。"
注意,他说的不是"做不到",而是"做得到但不敢做"。
为什么不敢?因为在正式训练之前,你至少需要完成五件事。
第一件事是选架构。 用稠密模型还是混合专家(MoE)?注意力机制怎么设计?层数多少?隐藏维度多大?每一种选择都会影响最终效果。这些选择没有标准答案,必须通过实验来比较。怎么实验?训练一批几十亿参数的小模型,每个只改变一个变量,然后看谁的表现最好。
第二件事是摸规律。 你需要搞清楚,模型从100亿参数扩大到1000亿参数,性能会提升多少?需要多少数据?这条曲线是什么形状的?这叫Scaling Law,缩放定律。你必须先在小规模上把这条曲线画出来,才能预测大规模模型的表现。否则你就是闭着眼睛往前冲。
第三件事是配数据。 代码、数学、英文网页、中文文本、科学论文,这些不同类型的数据按什么比例混合,直接决定模型在不同任务上的表现。代码多了,编程能力强但闲聊变弱。英文占比太高,中文就拉胯。最佳配比是什么?不知道,只能一遍一遍试。
第四件事是调超参数。 学习率多大?变化策略用哪种?预热阶段跑多长?这些超参数的最优值会随模型规模变化。在100亿参数模型上完美的方案,到了1万亿可能让训练直接崩掉。所以每次扩大规模,都需要重新调一遍。
第五件事是跑稳定性测试。 这个最关键,也最容易被低估。下一节展开讲。
以上五件事,每一件都需要真实地训练一批模型。不是纸上谈兵,必须用GPU去跑。而跑这些实验消耗的总算力,往往比最终的正式训练还要多。
训练稳定性:大模型的头号噩梦
如果说算力是"有没有资格参赛"的门槛,那训练稳定性就是"参赛之后能不能跑到终点"的核心考验。
模型越大,训练过程中出问题的概率越高。这不是一种模糊的感觉,而是有具体的技术原因。
先说梯度爆炸。神经网络训练时,误差信号需要从输出层一层一层往回传播,每经过一层就要乘一次该层的导数。如果这些导数倾向于大于1,经过几百层甚至上千层之后就会指数级放大。1.01的1000次方是多少?大约是21916。一个微小的倾向,经过足够多的层数积累,就变成了灾难。
你可能会说,这个问题不是有解法吗?梯度裁剪(gradient clipping)就是干这个的,当梯度超过某个阈值就把它截断。没错,这个方法确实能防止数值上的崩溃。但问题是,裁剪是一种粗暴的补救。被剪掉的梯度信息是真实丢失的,模型在那一步的学习就不完整了。小模型偶尔裁剪一次无所谓,但大模型因为层数多、参数多,触发裁剪的频率远高于小模型。频繁裁剪累积起来,会实质性地影响训练质量。而且裁剪的阈值本身也需要精心调节,在不同规模的模型上最优值可能完全不同。
所以"有解法"和"完美解决了"之间的距离,可能比你想象的要大得多。
再说一个更具体的案例。现代大模型都用"残差连接"来让信号在网络中顺畅传递,你可以理解为信号传输的高速公路。后来有研究者想把这条高速公路拓宽,让每一层能传递更多信息,这叫Hyper-Connections。听起来是个好主意。
但DS的研究团队发现,拓宽之后如果不加额外约束,信号每经过一层都会被略微放大。一层放大一点点不要紧。但经过几千层之后呢?放大效应是乘法累积的。他们实测发现,信号的增益幅度可以飙到原始值的3000倍。
3000倍意味着模型后面几层接收到的数值已经完全失控了。就像你把音响音量开到3000倍,不是声音更大了,是音响直接炸了。
最关键的一点是:这个问题在几百层的小模型上几乎看不出来。因为管道短,信号还没来得及累积放大到爆炸。只有当模型深到几千层,放大效应才会突然越过临界点。你在小规模实验中得出"这个架构没问题"的结论,放大十倍之后可能完全不成立。
还有"损失突刺"(loss spike)这个噩梦。训练过程中,损失值本来在平稳下降,突然毫无预兆地飙升一大截。原因可能是遇到了一批异常数据,也可能是优化器在参数空间的某个"悬崖"边缘滑了一跤。小模型也会遇到,但大模型因为训练时间极长、数据量极大,遇到的概率更高,每次突刺的后果也更严重。有时候模型能自己恢复过来,有时候恢复不了,性能永久性地下降了一截。如果在正式训练跑到60%的时候来一次无法恢复的突刺,前面几个月的算力投入就全打了水漂。
还有一种容易被忽视的不稳定因素:硬件故障。训练一个超大模型需要几万张GPU同时工作。这些GPU分布在大量物理服务器上,通过高速网络连接。每一台服务器、每一块GPU卡、每一条网络线缆都有一定的故障概率。8张GPU跑几周,一张卡都不坏很正常。但50000张GPU跑三个月,从概率上看,几乎可以保证期间会有硬件故障。任何一个节点(也就是一台服务器或一块GPU卡)出问题,都可能中断整个分布式训练,需要从最近的检查点恢复。集群越大,你花在"处理故障、恢复训练"上的时间占比越高,有效训练的效率越低。
所有这些不稳定因素叠加在一起,构成了一个核心矛盾:模型越大,你越需要确保训练方案万无一失。但万无一失只能通过一步步的实验来验证,而每一步实验本身就要消耗大量算力。
为什么不能跳级,以及最佳步幅是多少
到这里,为什么不能一步到位已经很清楚了。很多问题只有在特定规模上才会冒出来,你在小规模上根本遇不到。2万亿参数级别暴露的工程问题,可能在1万亿时根本没出现过。
那么一个自然的追问是:每次应该扩大多少?有没有一个最佳的增长倍数?
没有一个固定公式,但业界的经验大致是每次扩大3到10倍。
从历史来看,GPT系列的参数增长大致是:GPT-2约15亿,GPT-3约1750亿,跳了大约100倍。但GPT-3到GPT-4的跳跃就不再是单纯堆参数了,而是引入了MoE架构。Llama系列是7B、13B、70B这样的梯度,每步大约2到5倍。DS自己也是从几B到几十B再往上走。
关键不在于倍数本身,而在于你每一步都要有足够的实验来验证方案。如果你在100亿参数上做了充分的架构搜索和缩放定律拟合,你预测500亿的表现是比较靠谱的。但如果你直接从100亿跳到5万亿,跨了500倍,你的预测就极不可靠了。因为通信瓶颈、内存管理、训练稳定性这些工程问题,可能在中间某个规模突然冒出来,而你完全没有应对经验。
所以不是有一个神奇的倍数告诉你该跳多远,而是你的实验验证能力决定了你能安全跳多远。算力越多,能做的中间实验越多,就能跳得更远。算力少的时候只能小步走,这也正是中国公司面对的现实。
某人在交流会上直接亮了家底:"我们现在的资源,也只足够我们在十B激活的这个规模里面去做更多的实验。"而美国最大的模型已经做到了800B激活,差了将近两个数量级。这意味着DS必须在10B规模上把方案吃透,然后小心翼翼地推到几十B,几十B吃透再推到一百多B。每一步都不敢跳太远。
数据:另一堵正在逼近的墙
算力和训练稳定性之外,还有一个约束正在快速逼近,而且可能比前两者更加根本:高质量训练数据正在枯竭。
预训练数据不是越多越好。首先你得筛选。互联网上大量的垃圾网页、SEO注水内容、机器翻译的低质量文本、广告、恶意内容,这些混进训练数据只会拉低模型质量。所以数据处理本身就是一条完整的流水线:语言识别、质量打分、去重、有害内容过滤、领域分类,每一步都需要精心设计。
筛完之后能用的高质量数据有多少?Epoch AI的研究预测,按照当前的消耗速度,公开可用的高质量人类文本会在2026到2032年间被耗尽。
更麻烦的是,AI自己正在加速这个问题。互联网上的AI生成内容占比在快速增长,博客、新闻稿、社交媒体评论,越来越多出自AI之手。下一代模型的训练数据从互联网上抓取时,会不可避免地吃进这些AI生成的文本。研究表明,当AI反复学习自己的输出时,会发生"模型坍缩":每一代都丢失一点分布尾部的信息,几代之后输出变得越来越单调,越来越趋向平均值。
这个问题在我们后续的文章中会专门展开讨论。这里只想指出一点:即使算力和工程问题全部解决,数据可能是大模型扩张遇到的最终瓶颈。做一个50万亿参数的模型,你拿什么数据去喂它?
真正的竞赛发生在水面之下
回到最初的问题。既然模型越大越强,为什么不直接做一个50万亿参数的?
因为大模型竞赛的本质从来不是比谁的参数多。参数量只是一个结果,是研究能力和工程能力的外在体现。
真正的竞争发生在水面之下:谁能在更大的规模上做更可靠的预研实验,谁积累了更多只有在特定规模下才能获得的工程经验,谁的架构创新能让同等参数量发挥出更大的效能。
这有点像问"既然楼越高住的人越多,为什么不直接盖一万层的大楼"。答案不是缺砖头,而是你还没有掌握在那个高度上让大楼不倒的工程知识。砖头可以买,钢筋可以买,但"盖两百层楼不翻车的经验"只能从盖过一百层开始积累。
中美AI差距常常被简化为"芯片禁运"的叙事。这个叙事不能说错,但它只是冰山一角。即使明天所有芯片禁令全部取消,"研究经验"这种东西仍然需要时间来积累。你不可能跳过2万亿参数直接去做20万亿,正如你不能跳过盖10层楼的经验直接去盖200层。那些在2万亿规模上才会出现的问题,你在1万亿时根本想象不到。
某人给自己设定的目标很克制:"用美国几分之一的算力,把时间差距从12到18个月缩短到6个月、3个月。"他没有说超越。他说的是缩短差距,而且给出了一个具体的、有限的数字。
这种克制本身就是一种清醒。在一场比的是"谁踩过更多坑"的竞赛中,唯一的加速方式就是在每一步里提取更多的信息、犯更少的错、以更高的效率完成前置研究。
所以当你看到某家公司发布了一个3万亿参数的模型时,真正值得关注的不是"3万亿"这个数字本身,而是它背后意味着什么:这家公司已经踩过了从1万亿到3万亿之间所有的坑,积累了在那个规模上训练的全部经验。
这些经验才是真正的壁垒。不是算力,不是资金,不是论文数量。是你在黑暗中一步步摸索出来的路。
而这条路,只能自己走。
· · ·
我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,或者使用Claude和Claude code,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。
