# 什么才是不会被大模型发展所吞并的资产

> 龙虾AGI通用实验室 · 2026-06-26

有一种越来越普遍的看法：大模型越来越强，早晚会吞并一切，所以现在做的很多事情最终都会变得没有意义。

这个想法让一些人焦虑，也让一些人躺平。

但我最近一直在想一个问题：真的是"一切"都会被吞并吗？有没有什么东西，随着大模型变强，不但不会被吞掉，反而会越来越有价值？

换一种更精确的说法：大模型的能力沿着一个方向在增长，有没有什么资产，它的价值方向和大模型是正交的？也就是说，不在同一条轴上竞争，不存在被替代的问题，甚至随着模型变强反而更值钱。

我想了挺久，觉得确实存在这样的东西。

## 大模型能吞并什么，不能吞并什么

先想清楚大模型的能力到底从哪来。

它的核心燃料是公开语料。人类写下来的、发表过的、能被爬取的一切文本，构成了大模型训练的基础。所以大模型真正在吞并的，是公开知识能产生的价值。你会发现，但凡是公开知识能做的事情，翻译、摘要、写代码、回答百科问题，大模型都在快速逼近甚至超越人类。这部分价值确实在被迅速压平。

那反过来想，什么是它吃不到的？

我想到两种东西。

**第一种，是私有数据。** 企业内部的业务数据、用户行为记录、交易流水、内部沟通，这些从来不在公开语料里，模型训练的时候根本看不到。你的大模型再强，不知道我们公司上个月的销售数据长什么样，不知道我们的客户在哪个环节流失，不知道我们的供应链哪里有瓶颈。这些信息对我来说价值巨大，但对大模型来说是一片空白。

**第二种，是未被结构化的专业知识。** 行业专家脑子里的判断逻辑、经验路径、直觉。一个做了二十年风控的老手，他看到一笔交易，三秒钟就能感觉到"不对劲"，但你让他写下来为什么不对劲，他可能自己都说不清楚。一个资深的工程师排查故障的思路，一个老医生面对模糊症状时的鉴别路径，这些东西都没有变成文字，没有出现在任何论文、教材、博客或白皮书里。

而且这不是"还没来得及公开"的问题。这些知识有结构性的原因保持私有：有的是专家自己也表达不出来，它内化成了直觉；有的是表达出来对自己没好处，核心竞争力为什么要公开；有的是写出来脱离了具体场景，别人根本看不懂也用不上。能公开的知识早就公开了，剩下的才是真正的私有资产。

这两种东西有一个有趣的交汇点。硅谷现在最火的岗位之一叫 FDE（Forward Deployed Engineer，前线部署工程师），最早由 Palantir 发明，现在 OpenAI、Anthropic、Databricks 都在大量招人。这个岗位做的事情恰好同时覆盖了这两种资产：工程师直接嵌入客户内部，一边接触企业的私有数据，一边从业务专家那里提取那些从未被结构化的领域知识，然后把它们变成可运行的技术方案。FDE 岗位的爆发本身，就是市场对"私有知识越来越值钱"这个判断的验证。

## 一个自然的追问：如果未来模型足够聪明呢？

到这里可能有人会说，你讲的这些只是"暂时"吃不到。模型会越来越强，未来的 AI 也许足够聪明，能够从大量的成品中自己反推出那些隐性的方法论。

比如，给模型一万份优秀的行业分析报告，它难道不能自己悟出"好报告是怎么写的"吗？给它一百万个成功的投资决策案例，它难道不能逆向提炼出顶尖投资人的判断框架吗？

这个挑战是成立的。而且在部分情况下确实会发生。

如果方法论的痕迹已经留在了成品中，只是没有人把它显式地总结过，那么足够聪明的模型确实有可能从果倒推因。比如一万份好报告虽然没附带"写作方法论"，但报告本身的结构、用词习惯、论证逻辑里已经包含了方法论的影子。模型有能力从这些影子中还原出相当一部分规律。

这一类隐性知识的护城河确实只是暂时的。它的"私有"不是本质性的，只是模型能力暂时不够而已。

## 但这就引出了一个更深层的问题：所有的过程知识，都能从结果中被反推出来吗？

## 信息的不可逆压缩

答案是不能。而且这个"不能"不是因为模型不够聪明，而是信息论层面的硬限制。

关键在于一个事实：从过程到结果的映射，很多时候是"多对一"的。

什么意思？就是说，100 种不同的决策路径可能产生看起来一模一样的结果。你拿着结果去反推，面对的是 100 个候选答案，但你没有任何额外的信息来判断哪一个才是真正被使用的那个。这跟智力无关，跟模型能力无关。区分它们所需要的信息，根本不存在于你能观察到的输出里。它在"过程变成结果"的那一步，被不可逆地压缩掉了。

举一个直觉化的例子。

你吃到一道味道很好的菜。你能反推出厨师是先放盐还是后放盐吗？如果两种顺序最终呈现的口味完全一样，那无论你的味觉多灵敏，无论你吃多少次，你都永远无法从成品中分辨出这个区别。因为"先放还是后放"这个信息在最终的味道中被完全抹平了，它不可逆地消失了。

但如果厨师告诉你："我习惯先放盐，因为在慢炖的过程中盐会渗透进食材的纤维，和后放盐在表面的口感是不一样的"，你就获得了一条成品中不可见的知识。注意，这条知识不是你"不够聪明"所以看不出来，而是它在输出中真的不存在，你必须由知道答案的人主动告诉你。

这就是"专家点拨"的本质：把在从过程到结果的压缩中被丢弃的信息补回来。

再看一个更贴近 AI 讨论的例子。一个资深医生看一张 CT 影像，他的眼睛先扫哪个区域、在某个位置停留了多久、选择忽略了什么、为什么在某个不起眼的阴影上多看了一眼，这整个注意力分配的过程，没有出现在他最终写的诊断报告里。报告里只有结论："右肺下叶结节，建议进一步检查。"

你给模型一百万份"影像加诊断报告"的配对数据，它可以学会"什么样的影像对应什么诊断"。但它不一定能学会"一个专家是怎么高效地看影像的"，因为专家看影像的过程信息在最终的报告输出端被丢弃了。报告是过程的一个压缩投影，而这个投影丢失了维度。

## 三种不可逆的程度

如果更严格地划分，隐性知识的"可还原性"其实可以分成三个层次。

**第一种：纯粹不可逆。** 过程中的某些决策对最终输出完全没有可观测的影响。就像先放盐还是后放盐，如果最终味道真的一模一样，那无论多少数据、多强的模型，都不可能从结果端把这个信息恢复出来。这类知识只能由掌握它的人主动输出。

**第二种：实践中不可逆。** 理论上，如果你有足够多的样本，样本之间的统计规律可能会泄露一些过程的线索。还是用做菜的例子，如果你吃了这个厨师做的一千道菜，发现所有需要入味的菜都有某种微妙的共同特征，你也许能猜到"这个人倾向于让调料提前渗透"。单个样本不可逆，但海量样本的统计模式可能把部分过程信息"泄露"出来了。然而，所需的数据量可能大到完全不现实，或者现实中的噪声会把信号淹没。模型能力再强，数据不够就是不够。

**第三种：暂时不可逆。** 线索其实已经藏在数据里了，只是当前的模型还不够细致、不够聪明，没能把它挖掘出来。这一类会随着模型的进步被逐渐攻破。

前两种构成永久的护城河。第三种只是时间问题。

## 正交的真正含义

现在可以回到最初的问题了：什么是与大模型发展方向正交的资产？

"正交"在这里的含义很具体：两个方向互相独立，一个方向上的进步不会吃掉另一个方向上的价值。

大模型在沿着自己的方向进化，变得更聪明、更通用、更强大。但私有数据和不可逆的专业知识在另一个维度上。大模型的进化不会自动获得它们，因为它们不在训练语料里，也不在可以从输出反推的范围内。

更有意思的是，这两个维度不只是互不替代，还互相放大。大模型越强，对高质量私有数据接口的需求就越大。一个通用大模型就像一台强大的引擎，但引擎要跑起来需要燃料。私有数据和专业知识就是这个引擎在具体场景中发挥作用的燃料。引擎越强大，对优质燃料的需求越旺盛。

所以正确的变现方向不是把私有数据囤起来坐等升值，而是把它做成工具，做成大模型生态中不可替代的那一环。让大模型的通用能力和你的私有知识发生化学反应，这个反应产物才是真正的价值所在。

## 什么值得你现在就开始积累

回到最初那个让人焦虑的说法："大模型会吞并一切。"

现在可以给一个更精确的回答了。

大模型会吞并的是公开知识中能从结果反推出过程的那部分。这确实是很大一块。大量的写作、翻译、编程、分析工作正在被压平，这是事实。

但存在一类知识，它在从过程变成结果的环节中发生了不可逆的信息压缩。成品中不包含还原它所需的全部信息。这类知识不会因为模型变强而被吞并，因为瓶颈不在模型的智力，而在信息本身的丢失。

所以，如果你想积累不被时代吃掉的资产，去关注那些"多对一映射"中被压缩掉的东西。那是只有身处其中的人才能补回来的信息，是大模型无论多强都够不到的维度。

对个人来说，你在专业领域日复一日积累的那些"说不清道不明但确实管用"的经验判断，正在成为 AI 时代最稀缺的资源。提炼它，结构化它，把它变成工具。

对企业来说，不要只盯着大模型本身的竞赛。在正交方向上持续构建你的私有数据资产和专业知识工具。那是一条不会被吞噬的路。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/967faf/img_001.jpg)
