# 一个关于 AI 训练数据的反直觉真相

> 龙虾AGI通用实验室 · 2026-07-26

有一个问题看起来很简单，但越想越觉得奇怪：

AI 生成的数据，到底能不能用来训练 AI？

如果你的回答是"不能"，那怎么解释蒸馏？DS-R1 的成功就是靠大模型的输出来训练小模型，效果极好。整个行业都在用这个方法。

如果你的回答是"能"，那怎么解释模型坍缩？研究表明，当训练数据里混入大量 AI 生成的内容时，模型会一代比一代差，多样性丧失，能力退化。

同样是 AI 产出的数据，一个场景下是灵药，另一个场景下是毒药。这不矛盾吗？

这个矛盾的背后，藏着当前 AI 发展中一个最被低估的问题。把它想清楚，你会对整个大模型竞赛的胜负手有一个完全不同的理解。

## AI 学 AI，到底会怎么样？

先把"毒药"的那一面讲透。

假设有一个画家，画技精湛，风格多变，有时候画写实，有时候画抽象，偶尔还搞点实验性的前卫作品。他的作品集是丰富的、有层次的。

现在让一个学生临摹这位画家的所有作品，然后让这个学生也去创作。你觉得学生的作品会是什么样的？

大概率是：写实的部分还行，因为画家画得最多的就是写实，学生学到的样本最充分。抽象的部分就差一些，因为样本少。至于那些实验性的前卫作品？学生可能完全学不到，因为就那么几幅，在海量的写实作品里被淹没了。

学生的作品集会比画家的更"窄"。它保留了画家最常见的风格，但丢失了那些罕见的、边缘的、实验性的东西。

现在再让另一个学生来临摹这个学生的作品。第二个学生学到的分布就更窄了。因为第一个学生已经丢掉了一些东西，第二个学生在这个更窄的分布上再丢一轮。

这就是模型坍缩的核心机制。每一代 AI 在学习上一代的输出时，都会系统性地丢失分布中的"长尾"信息。

为什么会丢失？因为语言模型的训练目标就是预测最可能的下一个 token。这个目标天然偏好高概率的选择。当模型生成文本时，它倾向于走那条"最安全、最常见、最不出错"的路径。那些低概率但有价值的表达方式（独特的比喻、反常规的论证结构、小众领域的专业术语），在 AI 的输出中会被系统性地压低。

一代压低一点，两代压低一点，几代之后，长尾就消失了。

这个过程有一个更直观的类比：反复复印。你复印一份文件，质量还行。拿复印件再复印一次，细节开始模糊。拿第二份复印件再复印……十几次之后，原件上那些精微的笔触全部变成了灰色的糊状物。

但这个类比还不够准确，因为它暗示的是均匀的质量下降。模型坍缩比这更阴险。它不是均匀地变差，而是选择性地丢失。高频信息被保留甚至被强化，低频信息被丢弃。结果不是"整体变模糊"，而是"变得越来越千篇一律"。

如果你经常读 AI 生成的文章，可能已经感受到了这种"千篇一律"。那种总是用"首先、其次、最后"来组织段落的套路，那种永远正确但永远不深刻的分析，那种圆滑的、不犯错但也不出彩的表达。这就是分布坍缩的表征：模型在学自己的输出之后，趋向于一种"AI 味"的平均文体。

到这里，结论似乎很清楚了：AI 生成的数据不能用来训练 AI，否则会越来越差。

但问题来了。

## 蒸馏为什么就没事？

DS-R1 是 2025 年最成功的 AI 模型之一。它的核心方法就是蒸馏：让一个大的教师模型去解数学题、写代码，生成详细的推理过程，然后用这些推理过程作为训练数据去教一个更小的学生模型。

效果好得惊人。6B 参数的小模型，经过蒸馏之后，在某些推理任务上可以接近甚至匹配比它大几十倍的模型。

等一下。这不就是"用 AI 生成的数据来训练 AI"吗？为什么模型坍缩没有发生？

如果你在这里停下来想一想，会发现这个矛盾恰恰揭示了一条非常关键的分界线。

答案藏在一个词里：**验证**。

蒸馏的流程里有一个步骤是互联网上 AI 内容泛滥的场景中不存在的。教师模型生成一万条推理过程之后，不是所有的都被拿去训练。你会先验证：这道数学题的答案对不对？这段代码能不能跑通？逻辑推导有没有错误？

只有通过验证的那些才会被保留。

这意味着蒸馏数据经过了一轮严格的"自然选择"。错误的、低质量的、走了弯路的推理过程被淘汰了，只有正确的、高质量的被留下来。这些数据不是教师模型的"平均输出"，而是它的"最佳输出"。

而互联网上泛滥的 AI 生成内容呢？一个人让 ChatGPT 写一篇关于量子力学的科普文章，然后直接发到博客上。没有人检查里面的物理概念是否准确，没有人评估它的解释是否有独创性，没有人验证它的论证是否经得起推敲。这篇文章被下一代模型的爬虫抓取，混进了训练数据。

这就是区别。不是"AI 数据有害"或者"AI 数据无害"这么简单。关键在于有没有一个外部的质量控制机制。

有验证的 AI 数据，是精炼过的知识。 没有验证的 AI 数据，是未经过滤的噪音。

但这个区分立刻引出了下一个问题：验证这件事，在什么情况下是可行的？

数学题有标准答案，代码有测试用例，逻辑推导有形式化的验证方法。在这些领域，验证可以自动化、大规模地进行。所以合成数据在这些领域的效果非常好。

但一篇散文写得好不好？一个商业分析是否有洞察力？一段历史叙述是否抓住了关键因素？这些东西没有客观标准。验证只能靠人类来做，而人类验证的速度是有上限的。

这就是蒸馏方法的边界。它在"有客观对错标准"的领域是解药，但在"没有客观标准"的开放域，这个方法的威力会大打折扣。

某人在交流会上提到一个耐人寻味的细节：XXX 有一半的核心研究员在标数据。标数据本质上就是人类在做那个"验证"的工作。他说这件事"不卡在钱上，也不卡在卡上"，瓶颈是时间。因为人类验证数据的速度有天然上限。

到这里，"毒药还是解药"的矛盾基本解开了。但故事还没完。

## 学生真的不能超越老师吗？

蒸馏的一个常见说法是"学生模型很难超越教师模型"。直觉上这说得通：你从教师那里学东西，顶多学到跟教师一样好，怎么可能比教师还强？

但仔细想想，这个说法其实藏着一个漏洞。

考虑这样一个场景。一道极难的数学竞赛题，当前最强的模型直接去解，成功率可能只有万分之一。也就是说，你让它尝试一万次，大约只有一次能做对。

但那一次的推理过程是完全正确的。

现在你把这条正确的推理路径挑出来，连同题目一起作为训练数据。下一代模型学习了大量这样的"万里挑一的正确推理"之后，它在面对类似难题时的成功率可能从万分之一提升到了十分之一，甚至更高。

在这道具体的题目上，学生的稳定表现超越了教师。

教师在灵感爆发的时候偶尔能做到的事情，变成了学生的常规能力。这不就是"超越"吗？

这个过程的关键在于：你不是在学习教师的"平均能力"，而是在学习教师的"最佳时刻"。通过大量采样加外部验证，你从教师的能力分布中精确地挑选出了尾部（最好的那些输出），然后把这个尾部变成了下一代的中心。

这就是 RLHF 和 rejection sampling 的底层逻辑。它不是简单的"模仿教师"，而是"提纯教师最好的那部分"。

但这里有一个微妙的限制。

学生超越了教师的"平均水平"，但并没有超越教师的"能力边界"。教师在一万次尝试中完全做不到的事情，用这个方法训练出来的学生也做不到。你只是把教师偶尔能做到的变成了学生稳定能做到的，这不是在创造新能力，而是在固化已有能力分布中的峰值。

真正推高能力边界，让模型能做到上一代完全做不到的事情，需要的是别的东西：更大的模型规模，更多的原始人类数据，以及算法和架构层面的创新。

所以训练下一代模型的完整图景是这样的：预训练阶段用原始人类数据加上更大的模型来推高天花板，后训练阶段用上一代最强模型的精选输出来把天花板附近的能力固化为稳定表现。一个负责"向上探索"，一个负责"向上巩固"。

两者缺一不可。而在"向上探索"这一侧，人类数据是不可替代的燃料。

## 那个真正的问题

讲到这里，所有的线索汇聚到了一个问题上：人类数据还够用吗？

Epoch AI 的研究给出的预测是，如果当前趋势持续，高质量公开人类文本将在 2026 到 2032 年之间被模型训练"耗尽"。这不是说数据消失了，而是说增量的边际收益已经很低，该学的都学过了。

与此同时，AI 生成的内容正在以指数级的速度覆盖互联网。博客、评论、新闻摘要、产品描述、社交媒体帖子，越来越多出自 AI 之手。如果你今天去抓取新的网页数据用于预训练，里面已经混有大量 AI 生成的内容。不经清理就使用，模型坍缩的风险就在那里。

两条曲线正在交叉。一边是高质量人类数据增长放缓，另一边是 AI 噪音指数级增长。

一个讽刺的循环正在形成：AI 越成功，它产出的内容就越多。它产出的内容越多，互联网上干净的人类数据占比就越低。干净人类数据越少，下一代 AI 的训练就越困难。

这意味着什么？

意味着人类原创数据正在从一种充裕的公共品，悄悄变成一种稀缺的战略资源。

以前，训练大模型的瓶颈清单是：第一算力，第二资金，第三人才。数据？互联网上有的是。现在这个排序可能需要更新了。算力可以买（虽然贵），资金可以融，人才可以招。但高质量的、未被 AI 污染的人类文本？总量是有限的，而且每一天都在被稀释。

某人在交流会上反复强调 XX 跟美国的差距在"算力资源"上，但他同时透露了两个容易被忽略的信息。第一，一半的核心研究员在标数据。第二，高质量数据标注的瓶颈不是钱也不是卡，是时间。

这两个信息合在一起读，说明的是：即使在算力焦虑的笼罩下，数据质量的问题已经严峻到需要最宝贵的人力资源去应对了。

## 谁在赛跑

一旦认识到人类数据是稀缺资源，你就能看清一场隐性的赛跑正在发生。

这场赛跑不是"谁的 GPU 更多"（虽然那也很重要），而是"谁能在人类数据这个窗口关闭之前，把它的价值最大化地提取出来"。

窗口为什么会关闭？因为随着 AI 生成内容在互联网中的占比越来越高，未来从网上新抓取的数据将越来越难区分人类原创和 AI 生成。数据清洗的成本会越来越高，效果越来越差。2022 年以前的互联网快照将成为一种"数据化石"，其价值随着时间推移不断升高。

在这场赛跑中，起步早的有巨大的先发优势。不仅仅是因为他们已经用这些数据训练了更强的模型，更因为他们在长期的后训练和数据标注过程中积累了大量的高质量人类反馈数据。这些数据是内部的、私有的、无法复制的。

这也许是某人选择把"持续学习"作为下一个核心突破方向的深层原因之一。

持续学习本质上是在寻找一条跳出数据困境的路。如果 AI 不再依赖"一次性大规模预训练"的模式，而是能像人类一样在工作中不断学习新东西，那对预训练数据的依赖就会大幅降低。它的知识来源不再局限于互联网上的静态文本，而是整个动态变化的现实世界。

到那个阶段，"人类数据耗尽"这个问题就不再是约束了。

但在到达之前，有一个事实值得每个人认真对待：

在这场 AI 竞赛中，最终的胜负手可能不是谁拥有更多的 GPU，而是谁拥有更多的、未被 AI 污染的、真正由人类写下的文字，以及谁有能力把这些文字的价值压榨到极致。

芯片可以制造，算力可以购买。但人类几千年写下的文字只有这么多，用完就没有了。

而 AI 正在每一秒钟稀释它们。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，或者使用Claude和Claude code，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/c2b53b/img_001.jpg)
