# AI的草稿纸被曝光，有人说它发明了自己的语言？

> 龙虾AGI通用实验室 · 2026-07-05

## 一张截图引发的误解

最近有人给一个推理模型出了一道竞赛编程题，结果界面没有给出干净的答案，而是直接把模型的思考过程糊在了屏幕上。

满屏是英文碎片、数学符号，夹杂着"GRRR""PHEW""GAAAH"这样的怪词，还有一句突然爆发的"DATA DATA DATA. GO."。

消息传开之后，网上的说法很热闹：有人说AI泄露了"未经过滤的内心独白"，有人说它发明了自己的语言，有人说整个过程读起来像一个疯狂的穴居人在刻石板。

这些说法都很有传播力，但都不准确。

这篇文章想做三件事：先说清楚这张截图到底是什么，再说清楚它为什么长成这样，最后回答一个比"AI发明语言"更有趣的真问题：压缩成这样，难道不是在偷工减料吗？

## 先把最重要的事实说清楚：这就是思维链

这不是什么隐藏的内心世界被意外泄露。

如果你用过ChatGPT的o系列模型或者Claude，你可能点开过回答上方那个可以展开的"思考过程"。截图里的东西，在机制上和你平时看到的那个"思考过程"完全一样。

在之前文章《如何训练一个有洞察力的大模型》里，我详细讲过这个机制：让模型在给出最终答案之前，先输出一串"思考用的文字"。这些文字不展示给用户，但模型自己能看到，等于给了它一张草稿纸。模型可以在草稿纸上试方向、做推导、自我检查，想清楚了再把最终答案写在答卷上。

截图里那些看起来像外星文的内容，就是这张草稿纸。

那为什么它和你平时看到的思维链差别这么大？平时看到的都是完整的句子、有条理的推导，这次却是一堆碎片和怪叫？

因为你平时看到的思维链，很多是经过处理的。有些产品展示的不是原文，而是另一个模型写的摘要，天然通顺好看。有些模型在训练时专门加了"可读性约束"，要求思考过程也要像给人看的文字。而这次泄露的，大概率是原始的、没有可读性约束的思维链，被一个渲染事故（该折叠的没折叠）直接显示了出来。

所以准确的说法是：一份风格极端的思维链，因为显示bug被公开了。

没有"内心"，没有"独白"，没有"秘密语言"。模型没有一个平时藏着不让你看的内心世界。思维链就是它全部的"思考过程"，本来就是设计出来给模型自己看的中间输出。

## 那它为什么长成这样？

说它不是新语言，那它到底是什么？

仔细看截图内容，绝大部分还是英语单词加标准数学记号。没有自造词汇，没有独立的语法规则。一个懂英语和离散数学的人花点力气就能读懂，发截图的那个人不就读懂了嘛。

它更像是医生的病历缩写，或者数学家的演算纸：省掉了完整句子，但用的还是人类的符号系统。在语言学上，这叫"语域"变化，不叫新语言。什么时候算新语言呢？等草稿里的词在人类词典里查不到、组合规则用英语语法也解释不通、只能靠密码破译的方式去分析，那才算。

但问题来了：它为什么会演变成这样？没有人要求它这么写。

答案藏在训练方式里。

这类推理模型用的训练方法叫强化学习。核心逻辑很简单：模型做题，做对了奖励，做错了惩罚。奖励信号只看最终答案对不对，不看中间过程写得好不好看。

这意味着什么？意味着思维链里的文字只有一个读者，就是模型自己。而模型自己在读的时候，共享着全部的上下文，不需要任何"帮助理解"的辅助信息。

人类语言里有大量成分是专门为读者服务的：语法胶水（"因此""然而""也就是说"）、指代交代（"上文提到的那个变量"）、过渡句（"接下来我们来看第二种情况"）。这些存在的意义是让另一个大脑能跟上你的思路，是两个大脑之间隔着噪声信道通信时的必要冗余。

但如果收发双方是同一个大脑呢？这些冗余就是纯粹的浪费。

强化学习不知道什么是语法，什么是礼貌，什么是可读性。它只知道一件事：什么样的思维链能导向正确答案。于是，经过海量的训练迭代，所有"服务读者"的成分被自然淘汰了，就像进化会淘汰一切不帮助生存的特征。留下的是信息密度最高、对模型自身最有用的内容。

你给自己记的便签和写给同事的邮件差别有多大？这个差距就有多大，只是被强化学习推到了极端。

而且这个过程不是偶发的。DeepSeek团队在训练R1-Zero模型时观察到了同样的现象：原始思维链出现严重的语言混杂和压缩。团队后来加了"语言一致性"奖励，强制让它说人话。论文里明确记录了这样做带来了轻微的性能下降。

强迫模型用规范的人类语言思考，是有可测量的代价的。

## 一个直觉上的好问题：压缩了不就思考更少了吗？

看到这里，很多人会有一个本能反应：就算压缩有效率上的好处，但你把文字压短了，不就等于模型思考的步数变少了吗？

这个直觉的方向其实是对的。在上一篇文章里我讲过，模型每生成一个字，就要把所有层从头到尾完整走一遍（一次前向传播），每次前向传播能做的推理步数有上限。当一道题需要的推理步数超过这个上限，唯一的办法就是多写token来接力。所以"多写等于多想"这个大方向没有错，这是思维链有效的根本原因。

但这里有一个容易忽略的关键环节：token之间到底能带走什么。

## 关键转折：每个token都是稀缺带宽

这是理解整件事的核心。

《如何训练一个有洞察力的大模型》文章讲过一个概念：模型内部几千维的连续状态被迫压成一个离散的词，是一次巨大的信息丢失。我当时把它类比为量子坍缩。

现在需要把这个概念再往前推一步。

上篇文章讲的是"坍缩是一种代价"。这篇要讲的是这个代价的直接推论：**正因为每个token都是稀缺带宽，往里面塞什么就至关重要。**

这两篇文章的观点不是矛盾的，而是一枚硬币的两面。上篇告诉你每个字一旦写下就不能反悔，是一次不可撤销的承诺；这篇进一步告诉你，它不仅不能反悔，而且是模型唯一能把信息带到下一步的通道。

为什么这么说？因为模型没有一个持续存在的"脑子"。

每生成一个token，模型内部会做一次极其丰富的计算，几千维的向量在几十层之间流转、组合、变换。但这一切在选出一个词之后就全部丢弃了。下一步能看到的，只有纸面上写过的全部文字。

写下的文字不是思考的记录，它就是思考得以延续的唯一载体。

这意味着什么？意味着每个token的价值不在于"它触发了一次计算"，而在于"它往工作记忆里存入了什么"。

来看一个对比。

写一句"因此我们可以看到"，花掉六七个token。每个token确实都触发了一次完整的前向传播，几十层计算都跑了。但这六七个token往纸面上存入的有效信息是什么？几乎为零。后续任何一步推理试图从这几个字里调取可复用的结论，什么都捞不到。

写一小段"used[j]≤m−2"，花几个token。同样触发了几次前向传播。但这几个token往纸面上存入了一条精确的数学约束，后续每一步推理都能通过注意力机制直接检索到这条约束，用它来验证自己的推导是否正确。

同样的token预算，一个空转，一个入库。

所以"思考总量"不等于token数量。更准确的说法是：

## 有效思考量 ≈ token数量 × 每个token的信息密度

"多写等于多想"只在每个token都装着有效信息的前提下才成立。如果多写的全是语法胶水和客套过渡，那就是一百个"嗯"的升级版，计算量上去了，有效思考量没变。

## 所以压缩不是偷懒，是在有限预算内塞进更多真正的推理

Token数不是无限的。

有长度上限，有延迟和算力成本。而且已有研究表明，超长的思维链反而会让模型跑偏。这叫overthinking现象：草稿写太长，模型会推翻本来对的答案、跟丢主线、在分支里越绕越远。

在这个有限的预算内，压缩意味着同样的token数里装进了更多的假设检验、分支枚举和自我纠错。一千个token的压缩速记，可能包含的有效推理动作比三千个token的完整句子还多。

还有第二层好处。模型在生成新内容时，需要通过注意力机制从历史文本里捞回之前的关键结论。草稿越紧凑、信噪比越高，注意力越容易命中目标。废话会稀释检索效率，就像在一本满是废话的笔记本里翻找那条关键公式，页数越多越难找。

所以压缩的好处是双重的：写的时候塞进更多有效内容，读的时候更容易找到关键信息。

回到DeepSeek的案例：团队强制模型说人话之后，性能下降了。不是因为模型变笨了，而是因为同样的token预算里，人话需要花更多的位置来安放语法胶水，留给真正推理内容的空间就少了；同时检索关键信息时，注意力要穿越更多的废话才能命中目标。

## 那GRRR和PHEW又是怎么回事？

聊完了压缩的原理，回到截图里最吸引眼球的那几个词。

仔细看它们出现的位置：GRRR紧跟在一段推导撞墙的地方，前面的数学推理走到了矛盾；PHEW紧跟在一个让人担心的验证检查通过的地方；"DATA DATA DATA. GO."出现在模型决定停止纯数学推理、开始写代码做实验验证的转折点。

它们大概率不是情绪装饰，而是极其廉价的状态标记。GRRR约等于"这条路走不通，回退"。PHEW约等于"担心的那个边界条件检查通过了"。DATA DATA DATA. GO.约等于"别空想了，切换到写代码验证模式"。

一个token的成本，标记一次思维流的转折。而且后续回头定位时也更容易：如果模型需要找到"我在哪里放弃了方案A"，一个GRRR比一段完整的"经过以上分析，方案A存在如下问题，因此我决定放弃这个方向"要好找得多。

当然，也可能它们部分只是从人类自言自语的文本里继承的语言习惯。人烦躁了也会哼一声"啧"或者骂一句，模型在训练数据里见过大量这样的模式。两种解释各占多少比例，说不清。但无论哪种解释，它们都不贵，不碍事，而且可能有用，所以强化学习没有理由淘汰它们。

## 你看到的干净回答是论文正文，这些是演算纸

最后收一下全局。

模型给你的回复，经过了格式训练、对齐调优、可读性打磨，像一篇排版好的论文。泄露的草稿是真正的工作现场，凌乱、压缩、自言自语，像数学家的演算纸。

两者的关系不是"表面 vs 内心"。模型没有一个藏起来的内心世界。两者的关系是"答卷 vs 草稿纸"：一个是交给老师看的，要整洁规范；一个是给自己用的，怎么快怎么来。

论文里的证明优雅清晰，草稿纸上全是涂改、箭头、"不对不对"、"等一下这样行"。你不会说数学家在草稿纸上"发明了自己的语言"，你知道那只是他不需要给别人看时的自然状态。

说到底，你自己攻一道难题时，脑子里跑的大概也不是完整的句子。

AI没有发明语言。它只是被允许在没人看的时候，不再假装说人话。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/bf3d12/img_001.jpg)
