龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

什么才是不会被大模型发展所吞并的资产

格里灰丝2026-06-26约 3689 字Markdown 原文

有一种越来越普遍的看法:大模型越来越强,早晚会吞并一切,所以现在做的很多事情最终都会变得没有意义。

这个想法让一些人焦虑,也让一些人躺平。

但我最近一直在想一个问题:真的是"一切"都会被吞并吗?有没有什么东西,随着大模型变强,不但不会被吞掉,反而会越来越有价值?

换一种更精确的说法:大模型的能力沿着一个方向在增长,有没有什么资产,它的价值方向和大模型是正交的?也就是说,不在同一条轴上竞争,不存在被替代的问题,甚至随着模型变强反而更值钱。

我想了挺久,觉得确实存在这样的东西。

大模型能吞并什么,不能吞并什么

先想清楚大模型的能力到底从哪来。

它的核心燃料是公开语料。人类写下来的、发表过的、能被爬取的一切文本,构成了大模型训练的基础。所以大模型真正在吞并的,是公开知识能产生的价值。你会发现,但凡是公开知识能做的事情,翻译、摘要、写代码、回答百科问题,大模型都在快速逼近甚至超越人类。这部分价值确实在被迅速压平。

那反过来想,什么是它吃不到的?

我想到两种东西。

第一种,是私有数据。 企业内部的业务数据、用户行为记录、交易流水、内部沟通,这些从来不在公开语料里,模型训练的时候根本看不到。你的大模型再强,不知道我们公司上个月的销售数据长什么样,不知道我们的客户在哪个环节流失,不知道我们的供应链哪里有瓶颈。这些信息对我来说价值巨大,但对大模型来说是一片空白。

第二种,是未被结构化的专业知识。 行业专家脑子里的判断逻辑、经验路径、直觉。一个做了二十年风控的老手,他看到一笔交易,三秒钟就能感觉到"不对劲",但你让他写下来为什么不对劲,他可能自己都说不清楚。一个资深的工程师排查故障的思路,一个老医生面对模糊症状时的鉴别路径,这些东西都没有变成文字,没有出现在任何论文、教材、博客或白皮书里。

而且这不是"还没来得及公开"的问题。这些知识有结构性的原因保持私有:有的是专家自己也表达不出来,它内化成了直觉;有的是表达出来对自己没好处,核心竞争力为什么要公开;有的是写出来脱离了具体场景,别人根本看不懂也用不上。能公开的知识早就公开了,剩下的才是真正的私有资产。

这两种东西有一个有趣的交汇点。硅谷现在最火的岗位之一叫 FDE(Forward Deployed Engineer,前线部署工程师),最早由 Palantir 发明,现在 OpenAI、Anthropic、Databricks 都在大量招人。这个岗位做的事情恰好同时覆盖了这两种资产:工程师直接嵌入客户内部,一边接触企业的私有数据,一边从业务专家那里提取那些从未被结构化的领域知识,然后把它们变成可运行的技术方案。FDE 岗位的爆发本身,就是市场对"私有知识越来越值钱"这个判断的验证。

一个自然的追问:如果未来模型足够聪明呢?

到这里可能有人会说,你讲的这些只是"暂时"吃不到。模型会越来越强,未来的 AI 也许足够聪明,能够从大量的成品中自己反推出那些隐性的方法论。

比如,给模型一万份优秀的行业分析报告,它难道不能自己悟出"好报告是怎么写的"吗?给它一百万个成功的投资决策案例,它难道不能逆向提炼出顶尖投资人的判断框架吗?

这个挑战是成立的。而且在部分情况下确实会发生。

如果方法论的痕迹已经留在了成品中,只是没有人把它显式地总结过,那么足够聪明的模型确实有可能从果倒推因。比如一万份好报告虽然没附带"写作方法论",但报告本身的结构、用词习惯、论证逻辑里已经包含了方法论的影子。模型有能力从这些影子中还原出相当一部分规律。

这一类隐性知识的护城河确实只是暂时的。它的"私有"不是本质性的,只是模型能力暂时不够而已。

但这就引出了一个更深层的问题:所有的过程知识,都能从结果中被反推出来吗?

信息的不可逆压缩

答案是不能。而且这个"不能"不是因为模型不够聪明,而是信息论层面的硬限制。

关键在于一个事实:从过程到结果的映射,很多时候是"多对一"的。

什么意思?就是说,100 种不同的决策路径可能产生看起来一模一样的结果。你拿着结果去反推,面对的是 100 个候选答案,但你没有任何额外的信息来判断哪一个才是真正被使用的那个。这跟智力无关,跟模型能力无关。区分它们所需要的信息,根本不存在于你能观察到的输出里。它在"过程变成结果"的那一步,被不可逆地压缩掉了。

举一个直觉化的例子。

你吃到一道味道很好的菜。你能反推出厨师是先放盐还是后放盐吗?如果两种顺序最终呈现的口味完全一样,那无论你的味觉多灵敏,无论你吃多少次,你都永远无法从成品中分辨出这个区别。因为"先放还是后放"这个信息在最终的味道中被完全抹平了,它不可逆地消失了。

但如果厨师告诉你:"我习惯先放盐,因为在慢炖的过程中盐会渗透进食材的纤维,和后放盐在表面的口感是不一样的",你就获得了一条成品中不可见的知识。注意,这条知识不是你"不够聪明"所以看不出来,而是它在输出中真的不存在,你必须由知道答案的人主动告诉你。

这就是"专家点拨"的本质:把在从过程到结果的压缩中被丢弃的信息补回来。

再看一个更贴近 AI 讨论的例子。一个资深医生看一张 CT 影像,他的眼睛先扫哪个区域、在某个位置停留了多久、选择忽略了什么、为什么在某个不起眼的阴影上多看了一眼,这整个注意力分配的过程,没有出现在他最终写的诊断报告里。报告里只有结论:"右肺下叶结节,建议进一步检查。"

你给模型一百万份"影像加诊断报告"的配对数据,它可以学会"什么样的影像对应什么诊断"。但它不一定能学会"一个专家是怎么高效地看影像的",因为专家看影像的过程信息在最终的报告输出端被丢弃了。报告是过程的一个压缩投影,而这个投影丢失了维度。

三种不可逆的程度

如果更严格地划分,隐性知识的"可还原性"其实可以分成三个层次。

第一种:纯粹不可逆。 过程中的某些决策对最终输出完全没有可观测的影响。就像先放盐还是后放盐,如果最终味道真的一模一样,那无论多少数据、多强的模型,都不可能从结果端把这个信息恢复出来。这类知识只能由掌握它的人主动输出。

第二种:实践中不可逆。 理论上,如果你有足够多的样本,样本之间的统计规律可能会泄露一些过程的线索。还是用做菜的例子,如果你吃了这个厨师做的一千道菜,发现所有需要入味的菜都有某种微妙的共同特征,你也许能猜到"这个人倾向于让调料提前渗透"。单个样本不可逆,但海量样本的统计模式可能把部分过程信息"泄露"出来了。然而,所需的数据量可能大到完全不现实,或者现实中的噪声会把信号淹没。模型能力再强,数据不够就是不够。

第三种:暂时不可逆。 线索其实已经藏在数据里了,只是当前的模型还不够细致、不够聪明,没能把它挖掘出来。这一类会随着模型的进步被逐渐攻破。

前两种构成永久的护城河。第三种只是时间问题。

正交的真正含义

现在可以回到最初的问题了:什么是与大模型发展方向正交的资产?

"正交"在这里的含义很具体:两个方向互相独立,一个方向上的进步不会吃掉另一个方向上的价值。

大模型在沿着自己的方向进化,变得更聪明、更通用、更强大。但私有数据和不可逆的专业知识在另一个维度上。大模型的进化不会自动获得它们,因为它们不在训练语料里,也不在可以从输出反推的范围内。

更有意思的是,这两个维度不只是互不替代,还互相放大。大模型越强,对高质量私有数据接口的需求就越大。一个通用大模型就像一台强大的引擎,但引擎要跑起来需要燃料。私有数据和专业知识就是这个引擎在具体场景中发挥作用的燃料。引擎越强大,对优质燃料的需求越旺盛。

所以正确的变现方向不是把私有数据囤起来坐等升值,而是把它做成工具,做成大模型生态中不可替代的那一环。让大模型的通用能力和你的私有知识发生化学反应,这个反应产物才是真正的价值所在。

什么值得你现在就开始积累

回到最初那个让人焦虑的说法:"大模型会吞并一切。"

现在可以给一个更精确的回答了。

大模型会吞并的是公开知识中能从结果反推出过程的那部分。这确实是很大一块。大量的写作、翻译、编程、分析工作正在被压平,这是事实。

但存在一类知识,它在从过程变成结果的环节中发生了不可逆的信息压缩。成品中不包含还原它所需的全部信息。这类知识不会因为模型变强而被吞并,因为瓶颈不在模型的智力,而在信息本身的丢失。

所以,如果你想积累不被时代吃掉的资产,去关注那些"多对一映射"中被压缩掉的东西。那是只有身处其中的人才能补回来的信息,是大模型无论多强都够不到的维度。

对个人来说,你在专业领域日复一日积累的那些"说不清道不明但确实管用"的经验判断,正在成为 AI 时代最稀缺的资源。提炼它,结构化它,把它变成工具。

对企业来说,不要只盯着大模型本身的竞赛。在正交方向上持续构建你的私有数据资产和专业知识工具。那是一条不会被吞噬的路。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。

上一篇AI来了,我推荐高考完的亲戚报考"天坑"专业生物学下一篇FDE是大模型改造世界的最后一公里