龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

如何训练一个有洞察力的大模型?

格里灰丝2026-05-31约 6472 字Markdown 原文

上一篇文章《会编程的大模型千篇一律,有灵魂的大模型万里挑一》里,我们聊了一个让人困惑的现象:大模型越来越强,代码写得越来越好,但说出的话越来越像一个什么都知道、什么都不敢讲的优等生。

诊断做完了,一个自然的追问就浮出来了:既然问题找到了,能不能治?

更大胆一点问:能不能专门训练一个以洞察力为第一优先级的大模型?不是顺带希望它有洞察力,而是把"说出你想不到的东西"当作核心训练目标?

这个问题拆开来看,有三道关卡。每一道都很难,但每一道都不是原理上不可能。有意思的是,要看清这三道关卡,你得先理解一件大多数人从来没想过的事:AI在"想"一个字的时候,到底发生了什么。

一个字的代价

你问AI"中国的首都是哪里",它回答"北京"。

这两个字看起来轻飘飘的,但背后的过程远比直觉复杂。

大模型——比如GPT、Claude——的底层架构叫Transformer。你可以把它想象成一栋96层的大楼(具体层数因模型而异)。你的问题从一楼进去,经过每一层的加工处理,到96层的时候,模型输出一个概率分布——"北"这个字的概率最高——于是选了它。

这就是一次"前向传播"。从头到尾走一遍全部层,出来一个字。

然后,模型把"北"接到你问题的后面,形成新的输入:"中国的首都是哪里?北"。这个更长的输入再次从一楼走到96楼,完成第二次前向传播,输出下一个字:"京"。

所以一个关键事实是:生成每一个字,都要把所有层从头到尾完整走一遍。生成一百个字,就是一百次完整的前向传播。

到这里你可能觉得,这只是工程实现的细节,跟洞察力有什么关系?

关系大了。因为这个机制隐含着一个你没注意到的后果:每一个字的输出,都是一次不可撤销的承诺。

不可撤销的承诺

当模型写下第一个字的时候,这个字就进入了上下文。后面所有的计算都把它当作既成事实。如果模型一开头写了"从经济学角度来看",那后面整段话就被这个开头强烈地锁定了:要想突然转到"其实应该从心理学角度看",在概率上几乎不会发生,因为这样的跳跃和已有的上下文太不一致了。

这就好像你在下棋,但规则是手一旦碰到棋子就必须走,而且不能悔棋。你会怎么下?你会变得极度保守,只敢动那些你已经完全想清楚的棋子。

模型也是这样。因为每个字一旦输出就不能撤回,它在统计意义上倾向于选择最安全的、最常规的、概率最高的那个字,而不是冒险的、意外的、可能带来突破但也可能带偏全文的那个字。

但这还不是最严重的问题。

更严重的是:每个字的输出都是一次信息坍缩

在选定一个字之前,模型的内部状态是一个几千维的连续向量。这个向量里编码了它对当前问题的全部理解,所有的可能性、所有的犹豫、所有的微妙倾向。这是一个极其丰富的信息状态。

然后,模型被迫从词表里选一个词。

词表有多大?几万到十几万个选项。你要把一个几千维连续空间中的丰富状态,压缩成几万个离散选项中的一个。这是一次巨大的信息丢失。

类比一下:你脑子里对一个问题有一种复杂的、混合的、带着多种矛盾倾向的感觉。然后有人说"用一个词概括你现在的想法"。不管你选哪个词,你都丢掉了大量的东西。而且一旦你说出了那个词,你自己后续的思考也会被它锚定,你会不自觉地沿着那个词的方向继续想下去,而那些被排除掉的可能性就很难再回来了。

物理学里有个概念叫量子坍缩:测量之前,粒子处于多种状态的叠加;测量之后,坍缩为一个确定状态。模型输出一个字的过程,结构上非常类似:输出之前,模型的内部状态"叠加"着多种可能的思维方向;输出之后,坍缩为一个确定的词,其他方向消失。

每产出一个字,思维可能性空间就坍缩一次。几十个字之后,模型就被锁定在一条特定的思路上了:不是因为那条思路最好,而是因为前面的选择把其他思路都排除了。

这就是第一道关卡:当前模型的"思考"和人类的思考之间,有一道架构层面的根本鸿沟。

人类可以犹豫,可以停顿,可以想到一半推翻自己从头来过。模型不行。它一旦开口就必须一直说下去,不能停,不能反悔。

而洞察力恰恰诞生在人类思维最不"向前"的那些时刻:犹豫的时候,放空的时候,走到死胡同然后折返的时候。

思考token:一种聪明的妥协

了解了这个限制,你就能理解为什么OpenAI的o系列模型是一个重要的突破。

它的核心想法说起来很简单:让模型在给出最终答案之前,先输出一大串"思考用的文字"。这些中间文字不展示给用户,但模型自己能看到。

这等于什么?等于给了模型一个草稿纸。

之前,模型的每一个字都同时是思考过程和最终输出:你一边想一边说,说出来的就是交卷的答案。现在,你可以先在草稿纸上打草稿,试一个方向不对了就换一个,觉得想明白了再把最终答案写在答卷上。

但这里有一个容易产生的误解,值得仔细拆解。

有人会觉得:思考token有效,不就是因为多算了嘛?多花点计算资源,结果当然更好。

这个直觉看似合理,但是错的。

如果"多算必然好"是对的,那提升AI的方法就极其简单了:给它更多层、更大参数就行了。事实上,单纯增加参数的收益递减非常快。而且你可以设想一种最笨的"多算"方式:让模型在回答之前先输出一百个"嗯"。一百个"嗯"意味着一百次完整的前向传播,计算量大大增加了。效果会好吗?不会,甚至可能更差,因为这一百个"嗯"没有给后续的计算提供任何有用的新信息。

思考token之所以有效,不是因为多算了,而是因为多出来的计算是有结构的

具体来说,它做了三件之前做不到的事。

第一,它引入了试错权。 模型可以在思考过程中写下"让我试试方案A……不对,A有问题,换方案B"。这种自我否定和方向切换,在直接输出最终答案时几乎不会发生,因为"不对"这两个字一旦出现在最终回答里,整个回答的质量就崩了。但在草稿里,它是安全的。

第二,它创造了自反馈回路。 模型在第五步思考时能看到自己第一到第四步写了什么,然后对之前的推理进行评估和修正。它可以说"等等,我第二步的假设有问题"。这种自我监控和自我纠正的能力,是性能提升的真正来源,不是多算了,而是后面的计算能看到并修正前面的计算。

第三,也是最微妙的一点:它增加了串行深度。

这需要稍微解释一下。还记得那栋96层的大楼吗?每生成一个字,数据就从1楼走到96楼。这96层不是96个做同样事情的小工位,每一层学到的东西不一样,浅层处理语法和局部模式,深层处理抽象语义和高级推理,它们是作为一个不可拆分的整体协同工作的。

这意味着什么?意味着一次前向传播,就是模型的一个基本计算单元。就像一次心跳是心脏的一个基本单元一样,你不能把半次心跳拿来用。

现在考虑一个多步推理任务:如果A那么B,如果B那么C,一直推到T,共20步,每一步都依赖前一步的结论。一次前向传播(一个完整的96层)能做的推理复杂度是有上限的,它擅长做一步高质量的推理,但你很难指望它在一次性的计算中把20步串行推理全部做完。

但如果你用思考token把这20步推理展开呢?第一步推理产出一段思考文字,用了完整的96层来做"A→B"这一步。第二步推理又触发一次完整的前向传播,又用了完整的96层来做"B→C",而且这次的输入里已经包含了"B"这个中间结论。

20步推理,20次完整的前向传播,每次都有完整的96层作为一个整体来工作。

对比一下:不用思考token,模型只有一次前向传播的机会,要一口气做完所有推理。用了思考token,每一步推理都有一个完整的计算单元可用,还能建立在前一步的显式结论之上。

这就是"多算"真正的价值所在:关键不在于算力的总量增加了,而在于额外的计算被组织成了可试错的、有反馈的、串行深度增加的结构

一百个"嗯"和二十步有结构的推理,计算量可能差不多,效果天差地别。

这里有一个更普遍的道理:智能的提升从来不是资源问题,而是资源的组织方式问题。 给一个人更多的时间不一定让他想得更深,但给他一个允许试错、回溯和自我质疑的环境,就有可能。

思考token的天花板

思考token是一个重要的进步,但它没有完全解决问题。

为什么?因为那些"思考用的文字"虽然不展示给用户,但仍然是文字。它们仍然要经过那个从连续向量到离散词的瓶颈。模型在思考的时候,每一步仍然要选一个具体的词,仍然会丢失那些还没成形的、模糊的、混合的内部状态。

人类的思考不是这样的。

你在琢磨一个难题的时候,脑子里发生的大量计算是前语言的。你有模糊的直觉、空间化的感觉、说不清楚但能指导方向的倾向。你可能在考虑一个商业决策时,脑子里浮现的不是一句话,而是一种"这个方向感觉不对"的模糊不适。这种不适本身就是思考的产物:你的大脑做了某种评估,得出了一个结论,但这个结论还没有被翻译成语言。

而当前的模型没有这种"前语言的思考"。它的每一步计算都必须变成一个词。它没有"沉默地想一想"的选项。

这就引向了一些更前沿的研究方向:让模型在一个不需要输出文字的空间里先"想"一轮。

一种思路是引入"暂停token",一种特殊的token,不代表任何文字,只代表"在这里多算几步"。模型遇到难题时可以产出一串暂停token,每个token不输出任何有意义的词,但模型的内部状态在每一步都在更新和精炼。

另一种更激进的思路是让模型直接在隐空间里做推理,也就是那个几千维的连续向量空间,不经过"翻译成词"这一步。中间过程不是一串单词,而是一串向量,每个向量代表一种还未成形的、模糊的高维"想法"。只有在最后,当模型觉得想得差不多了,才把最终结论翻译成人类可读的文字。

这个思路之所以诱人,是因为连续空间比离散的词表要丰富得多。一个词只能是词表中的某一个确定选项,但一个隐空间中的向量可以代表任意概念之间的任意混合,如30%的经济学加70%的心理学再加一丝建筑美学。这种混合在词的层面是不可表达的(你写不出一个"30%经济学"的词),但在隐空间中是自然存在的。

而洞察,也即那种跨领域的意外联系,很可能恰恰需要这种混合状态来酝酿。

还有一种思路叫循环隐空间计算,让模型的内部状态可以循环回去再加工一轮,再一轮,反复精炼,直到收敛到一个稳定的、自洽的结论。这非常接近人脑的实际工作方式,大脑皮层充满了循环连接,信息在不同脑区之间来回流动,你"想了很久终于想通"的体验,对应的就是这种循环计算。

这些方向都还在早期阶段,但它们指向同一个愿景:让AI从"边想边说"走向"想好了再说"。不是技术上的微调,而是计算范式的根本转变。

好了,架构的问题讲清楚了。假设未来某天,架构的限制真的被突破了,模型有了足够的认知自由度来做非线性的、可回溯的思考。那是不是就能训练出"洞察模型"了?

没这么简单。因为还有第二道关卡。

品味可以自我训练吗

即使模型有了足够灵活的思考方式,你仍然需要一个东西来训练它:反馈信号。模型需要知道"这个输出有洞察力"还是"这个输出是废话",才能学会区分二者。

谁来提供这个信号?

上一篇文章讨论了这个问题的困难之处:洞察力没有编译器,标注员的品味会被稀释,多数投票恰恰会惩罚真正的洞察(因为洞察在诞生时往往是反共识的)。

但这里我想聊一个更深的问题:AI能不能自己训练自己的品味?

现在的AI已经能自己写代码来改造自己了,自动优化性能、减少bug、提高效率。那品味能不能也走同样的路?自我迭代,自我提升?

这里藏着一个非常优雅的悖论。

AI"写代码改造自己"之所以可行,是因为改进的标准在自己之外。写了一段新代码,能不能跑,快了还是慢了,裁判是编译器和测试集,不是AI自己。AI不需要"理解"什么是好代码,它只需要看外部信号。

但品味的自我提升要求你先有品味来判断自己是否提升了。

这是一个"拉着自己头发把自己提起来"的问题。一个品味平庸的系统在自我改进时,最可能的结果不是变得深刻,而是变得更精致地平庸。它会在自己的审美舒适区里越来越熟练,误以为那就是进步。

对人类也一样。一个审美水平有限的人在没有外部刺激的情况下"自我提升品味",大概率就是在舒适区里越转越顺。真正的品味突破几乎总是来自外部冲击:遇到一个更好的老师,读到一本超出理解范围的书,被一件作品击中但说不清为什么。那个"说不清为什么"恰恰是关键:品味的成长发生在你的判断力还跟不上你的感受力的那个缝隙里。

所以品味的提升是不是完全无解呢?

不是。这里有一个微妙的突破口。

从"自知其无知"开始

也许品味提升的起点不是"学会什么是好的",而是学会识别自己什么时候在平庸

这有一条可操作的技术路径。模型在产出每一个字的时候,内部有一个概率分布,当它真的"知道"时,分布尖锐;当它在编的时候,分布平坦,好几个候选差不多,但它还是硬选了一个,表现得信心十足。这个内部信号可以被训练成一种自我监测能力:检测到"我在编"的模式时,主动承认不确定。这在技术上叫校准:先学会识别废话,再谈什么是洞察。

但更有意思的是下一步推论。

如果模型对某个问题的回答和它见过的大多数文本高度一致,那作为"洞察"的可信度反而应该降低。因为高度一致意味着它大概率只是在复述共识。真正的洞察在诞生的那个瞬间几乎总是反共识的,如果所有人都已经这么想了,那它就不叫洞察了。

与训练数据一致性越高,洞察可信度越低。

这条原则如果能被编码进训练过程,可能是打开品味问题的一把钥匙。不是教模型"什么是好的"(这太难了),而是教模型"什么太平庸了不值得说"(这可以用统计方法逼近)。

当然,反共识不等于有洞察力,大量的反共识观点纯粹是胡说八道。但如果结合校准技术(模型知道自己什么时候在编),你就有了一个双重过滤器:既不是在复述共识,也不是在胡编乱造,这个交集区域,虽然不完美,但已经比现在的训练方式更接近洞察了。

拼起全图

上一篇文章分析过洞察产生的四步结构:浸泡、松动、碰撞、识别。现在可以给每一步匹配技术对策了:浸泡,大模型天然具备,不是瓶颈;松动,需要架构突破,从思考token到隐空间推理,在走但没走通;碰撞,模型有跨域联想的天然优势,但缺少释放这种优势的计算机制;识别,就是品味,目前最可行的路径是校准加一致性检测的双重过滤。

四步中,第一步已经解决,第三步有天然优势但缺少释放机制,第二步和第四步是真正的硬骨头。

一个比模型架构更大的问题

写到这里,你可能注意到了一件事:这篇文章讨论的所有技术方案——思考token、隐空间推理、校准、一致性检测——没有一个涉及"让模型更大"或"给更多数据"。

这不是巧合。

训练一个有洞察力的模型所面临的障碍,没有一个是资源瓶颈。不是算力不够,不是数据不够,不是参数不够。每一个障碍要么是架构设计上的(模型的思考方式不支持洞察所需的认知过程),要么是方法论上的(不知道如何度量和训练洞察力),要么是哲学上的(品味本身的自指悖论)。

这意味着,洞察模型的突破不会来自"更大的GPU集群",而会来自对智能本身更深的理解

如果有人能把"洞察的计算理论"真正建立起来,在信息处理的意义上搞清楚洞察到底是什么,用什么数学结构来描述它,如何度量它,那它对AI发展的意义可能比下一代芯片还大。

这让我想到一个有点反讽的结论。

大模型训练到现在,技术社区最热衷讨论的是参数量、训练数据、上下文长度、推理速度。这些都是工程问题,都可以用钱解决。但真正卡住洞察力的那些问题:什么是深度思考?如何度量它?品味能否被形式化?这些是人文问题,是哲学问题,是认知科学问题。

它们不能用钱解决。

AI发展的前沿,正在从一个纯工程的世界移向一个需要人文思维的世界。训练一个有洞察力的模型,最终需要的可能不是更强的程序员,而是那些真正理解"什么是好的思考"的人。

如何训练一个有洞察力的模型?

先对洞察本身形成足够的洞察。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,群里大家都在真搞。

上一篇会编程的大模型千篇一律,有灵魂的大模型万里挑一下一篇大模型的Token生成动力学漫谈