假设有一天,OpenAI和Anthropic决定合并。不是资本层面的并购,而是最彻底的那种合并:两支全球最顶尖的AI团队坐在一起,所有的训练经验、技术诀窍、踩过的坑、内部从未发表的实验记录,全部摊开在桌上,然后从零开始共同打造一个新的模型。
这个模型会有多强?
直觉上,答案似乎很简单:肯定比任何一家单独做的都强。但如果你认真追问下去,这个"强多少"的问题会把你带进AI能力增长最核心的几个议题里。它迫使你思考:AI的能力到底受什么约束?这些约束是可以突破的,还是有某种根本性的极限?
这篇文章试图层层拆解这个问题。
先说最直观的部分。两支团队的经验合并,价值有多大?
答案是:可能比想象中还要大。
AI训练中存在大量的隐性知识,也就是那些"踩过坑才知道"的东西。数据清洗中哪些细微的偏差会导致模型在下游任务中产生幻觉,RLHF的奖励模型怎么设计才不会被模型钻空子,某个看似微不足道的架构改动在小规模实验中毫无效果但在万亿参数级别突然涌现出惊人的优势……这些经验很少写进论文里,是每家公司用真金白银(通常是几亿美元级别的训练成本)换来的核心积累。
OpenAI的翁家翌在一次访谈中提到过一个很有启发性的观点:每家公司的训练基础设施(Infrastructure)都有不同程度的bug,谁修的bug多,谁的模型性能就越好。他说的是底层的训练系统,分布式计算的稳定性、数据管道的正确性、强化学习框架的迭代效率,这些看起来不那么"性感"的工程层面。外界以为模型之间的差距来自算法上的天才灵感,但内部视角看,很多时候就是谁的基础设施更干净、bug更少。
这个视角可以进一步延伸。不仅仅是基础设施层面,在模型训练的每一个环节,数据选择和清洗的策略、后训练阶段的对齐方法、推理能力的强化技巧,各家公司都积累了各自独特的经验教训。OpenAI在代码生成和工具使用上打磨得更深,Anthropic在安全对齐、长文本理解和推理链的一致性上投入了更多精力。这些能力之间并不冲突,它们是在不同方向上解决不同的问题。
如果两支团队真的把这些全部共享了,效果应该不是1+1=2,而是能避免大量重复踩坑的时间。AI训练中有一个很残酷的现实:很多时候一个团队花了几个月、烧掉几千万美元做了一个大规模实验,最后发现方向不对。但这个"不对"的经验本身极其宝贵。如果另一个团队已经知道这条路走不通,你就可以直接跳过,把资源投在更有前景的方向上。
但这一层的提升有没有上限?有。上限在于:当两家公司各自踩过的坑和积累的技巧都被穷举式地合并之后,"合并经验"这件事本身就完成了。接下来想要继续提升,就不能靠"把已有的知识拼在一起"了,而是需要去探索未知领域、发明新方法。换句话说,合并经验能消除已知的低效,但不能自动创造新的突破。
那新的突破从哪里来?这就引出了第二层。
这一层触及一个更深的问题:如果给你无限的计算资源,AI能无限变强吗?
要回答这个问题,先要理解一种叫"迭代放大"(Iterated Amplification)的思路。它的基本想法是这样的:假设你有一个能力一般的AI助手H,单独一个H解决不了某个难题。但如果允许H把这个问题拆解成很多子问题,然后把每个子问题分别交给H的多个副本去处理,最后汇总结果,就有可能解决比H自身能力更高的问题。
然后,用这个"放大后的H"产生的高质量数据去训练一个新的模型H'。H'单独就能达到"放大后的H"的水平。接着再对H'做同样的放大操作,用产生的数据训练H''。如此迭代下去。
关键问题是:每一轮迭代,模型是真的变"更强"了(能处理更难的问题),还是只是变"更快"了(同样的问题用更少资源完成)?
答案是真的更强了。H单独能解决难度D的问题。放大后的H能解决难度D+的问题。H'单独就能解决D+级别的问题。再放大H',能解决D++的问题。训练出的H''又能单独处理D++。每一轮迭代,能力的天花板确实在抬高,而不只是效率在改善。
但这里有一个至关重要的区分:什么样的"难"可以通过堆算力解决,什么样的"难"不可以?
有些问题之所以"难",不是因为它本质上超出了某种认知能力,而是因为它太"复杂",需要协调大量子任务,每个子任务本身并不特别困难。就像组织一场万人规模的活动,每个环节都不复杂,但协调所有环节需要巨大的精力。这类问题可以通过拆分和堆算力来解决。
但另一些问题是"真的难"。它的核心包含某种不可分解的智力挑战,你不能把它拆成更简单的子问题,因为难度恰恰就在于那个不可分的整体。就像证明一个全新的数学定理,有时候你需要发明一种全新的思考方式,这种"发明"本身不能被机械地分解。
所以算力堆叠能否无限提升智能,取决于我们面对的问题世界里,"复杂"和"真的难"各占多少比例。如果大多数有价值的问题本质上都是"复杂"而非"真的难",那算力堆叠就是一条通往超级智能的坦途。但如果很多关键问题包含不可分解的核心难点,那算力堆叠就会在某个点撞上硬墙。
目前的经验证据倾向于乐观:很多曾经被认为需要"天才灵感"的问题(比如蛋白质折叠预测),后来被证明可以通过大规模计算和数据来解决。但我们不能确定这个趋势是否会永远持续。
这里还有一个有趣的细节值得讨论:在迭代放大的过程中,每一轮把"放大后的H"蒸馏成H'时,是否必然有能力损耗?直觉上似乎是的,学生怎么可能完全复现老师的能力?但实际情况更微妙。蒸馏过程中的信息转移带有随机性,而这种随机性不总是有害的。有时候,"学生"在模仿"老师"的过程中,恰好过滤掉了老师自己都没意识到的一些噪声和过拟合模式,反而学到了更干净、更本质的规律。就像一个学生听课时没有记住所有细节,但恰恰因此抓住了核心逻辑,在某些方面的理解甚至超过了老师。
这意味着,如果精心设计蒸馏过程,迭代放大的每一轮不一定是"有损复制",有可能成为"有增益的进化"。这是一个让人兴奋的可能性。
第二层的结论是:算力堆叠确实能提升智能,而且每一轮迭代确实在抬高能力天花板,但提升的幅度可能逐轮递减,最终是否收敛取决于问题的本质结构。
前两层讨论的都是在现有技术框架内的优化空间。但如果框架本身有天花板呢?
Transformer架构从2017年提出至今统治了整个深度学习领域。GPT系列、Claude系列、Gemini系列,底层都是Transformer。这个架构的成功毋庸置疑,但它确实有几个结构性的局限,而且这些局限指向的方向很一致:Transformer可能不是"终极架构"。
Transformer的核心是自注意力机制:序列中的每个token都直接"看到"所有其他token。这在理论上很优雅,但计算和内存的开销与序列长度的平方成正比。序列长度翻倍,计算量翻四倍。
各种工程优化(FlashAttention、稀疏注意力、滑动窗口等)已经把实际可用的上下文长度推到了百万token级别,在一定程度上缓解了这个问题。但即便上下文窗口扩大了,另一个更深层的问题随之浮现:模型并不真的在有效"利用"所有塞进去的信息。研究表明存在"lost in the middle"现象:模型对上下文开头和结尾的信息利用得好,中间部分的信息容易被忽略。也就是说,"能装下"和"能用好"是两回事。
为什么会这样?这就涉及到Transformer处理信息的一个更根本的特点:它对所有token基本是"平等对待"的,缺乏层次化的信息压缩能力。而人类读一本书的方式完全不同,人类不会同时在脑中保持每一个句子,而是不断压缩、抽象,形成层次化的记忆结构:关键信息被提升为概念和要点,细节在需要时再回溯原文。这种"有主次的记忆"正是Transformer目前缺少的。它把所有token都铺在同一个平面上处理,在短序列上这不是问题,但在面对一本书、一段长期项目历史、或一场延续几周的对话时,就成了根本性的瓶颈。
当前的大模型有一个固定的训练截止日期。训练完成后,知识就冻结了。想让它学新东西,要么花巨资重新训练,要么在推理时通过上下文"临时告诉它"(受限于上下文长度)。
人类不是这样的。人类每天都在吸收新信息,并把新信息整合到已有的知识体系中,通常不会因为学了新东西就忘掉旧的。但Transformer面临一个叫"灾难性遗忘"的问题:如果在训练好的模型上继续训练新数据,模型会迅速丢失之前学到的东西。这就像一块白板,写新内容时必须先擦掉旧的。
这个局限在实际中意味着巨大的成本:每隔几个月就要用全量数据(加上新数据)重新训练一遍。不能像人类一样"增量学习",是当前AI系统一个非常根本的缺陷。
Transformer生成每一个token时,花费的计算量基本相同,不管是生成一个简单的"的"字还是做一步关键的推理判断。但直觉上,简单的token应该可以"少想一点",难的token应该"多想一点"。人类就是这样运作的:简单的话脱口而出,复杂的问题会停下来深思。
目前的chain-of-thought和各种推理模型在一定程度上缓解了这个问题,方式是让模型在输出层面多"说"几步来展开推理。但本质上,模型在每一步的计算深度(等于Transformer的层数)仍然是固定的。理想情况下,模型应该能根据问题的难度动态分配算力,简单的问题浅算一下就出结果,难的问题深入计算很多轮再给出答案。这种"自适应计算"的能力,Transformer原生不具备。
这些局限共同指向一个方向:未来可能需要一种具有层次化记忆、增量学习能力、自适应计算深度的新架构。
目前有几个有前景的候选方向正在被积极研究。
状态空间模型(SSM) 是其中最受关注的一个。它的核心思路和Transformer完全不同:不是让每个token回看所有历史token(代价为N²),而是维护一个固定大小的"状态向量"。每读入一个新token,根据当前状态和新输入来更新状态,输出也从当前状态生成。
一个直观的类比:Transformer像一个有完美记忆的人,每次发言前回顾所有历史对话。SSM像一个随身带笔记本的人,每听到新信息就更新笔记,回答问题时看笔记而不翻原始记录。
SSM的优势是计算量与序列长度线性相关(而非平方),处理超长序列时效率高得多。而且Mamba等新一代SSM引入了"选择性机制",让模型能动态决定哪些信息值得记住、哪些可以忘掉,解决了早期SSM不能有效筛选信息的问题。
但SSM的劣势也很明显:那个固定大小的状态向量就是信息瓶颈。如果需要精确回忆很久以前的某个具体细节,SSM可能做不到,因为细节在压缩过程中可能已经丢失。Transformer在这方面更好,因为它可以直接"回头看"。
混合架构(Transformer + SSM) 试图兼取两者之长。在模型的不同层交替使用Transformer层和SSM层:SSM层负责高效处理长距离信息、压缩序列,Transformer层在需要精确回溯时提供细粒度的注意力。就像人脑中长期记忆系统负责压缩存储,工作记忆负责处理当前任务中需要精确操作的信息。
外部记忆网络 的思路更加激进。与其让模型把所有知识编码在参数里(知识越多,模型就得越大),不如给模型一个外部的、可读写的记忆模块。模型的核心只需要是一个高效的"推理引擎",知识存在外面,需要时检索,学到新东西时写入。
这种架构对持续学习特别有吸引力:学新知识不需要重新训练参数,只要往记忆库里添加内容。忘记某个过时的知识,直接删除。灾难性遗忘的问题从根本上被绕过了。
目前的RAG(检索增强生成)可以看作这个方向的一个简化版本。但真正的记忆网络比RAG更深度集成:记忆的读写是模型架构的一部分,而不是一个外挂的检索步骤。
这几个方向并不互斥。最终的"下一代架构"很可能是一种融合:SSM层做高效的长距离序列处理,Transformer层提供关键位置的精确注意力,外部记忆模块存储和检索大量知识,再加上某种自适应计算机制让模型能根据问题难度动态分配推理深度。
现在回到开头的问题:如果两支最顶尖的AI团队真的合并了所有的经验和教训,从零打造一个模型,它能强到什么程度?
答案是分层的。
在第一层,合并双方的经验和技术积累可以产生一个明显优于任何一家单独产品的模型,大约相当于把一到两代的进步压缩到一次。这主要是因为避免了大量重复踩坑,让每一分资源都花在刀刃上。
在第二层,如果再加上充足的算力,通过迭代放大等技术不断推高能力天花板,模型能处理的问题复杂度可以持续提升。但提升的幅度可能逐轮递减,而且主要解决的是"复杂"类问题,对"真的难"的问题效果有限。
在第三层,如果这支合并团队还在架构上取得了突破,不再局限于Transformer,而是发展出具有层次化记忆、持续学习、自适应计算能力的新架构,那能力提升将远超前两层加起来的效果。
AI能力的天花板不是一个固定的屋顶。它更像是一层一层的云层:穿过一层以为到顶了,上面还有。经验合并能穿过第一层,算力堆叠能穿过第二层,但真正的质变来自架构范式的革新。而我们现在,可能还只是在穿越早期的几层云。
那么,有一个比"AI能有多强"更关键的问题随之而来:当AI变得越来越强,甚至在某些领域超过了人类,我们怎么确保它变强的方向是对的?谁来告诉一个超越了人类标注者的AI,什么是"好的"回答?
这是下一篇文章要讨论的问题。
我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。
