# 当我们再也看不懂更高级的 AI

> 龙虾AGI通用实验室 · 2026-09-25

用 Claude Opus 5.5 越久，我心里有一个念头就越清晰：它给我的很多东西，我其实已经没法完全检查了。

它说一段代码没问题，我大致看得懂思路，但真要逐行确认每个细节，我做不到。它把一个复杂问题分析得头头是道，我觉得有道理，可如果让我说出它哪里可能错了，我也说不上来。我之所以接受，很大程度上是因为它以前大多是对的。

这不只是一个普通用户的处境。今天，一个普通人已经很难逐一核验 AI 的输出，但至少还有专家可以把关。可 AI 的能力还在快速提升，终有一天，面对它的将是人类最顶尖的专家，甚至是全人类的集体智慧，而连他们也跟不上了。

到那时，人类作为一个整体，还能判断 AI 说得对不对吗？

这篇文章想顺着这个问题，把它拆开，一层一层想清楚。

## 一、理解的失守：人类是否终将看不懂 AI

答案是会，而且已经开始了。

2016 年，AlphaGo 与李世石对弈的第二局，第 37 手，AlphaGo 把棋子落在了一个让所有职业棋手都困惑的位置。现场解说一度以为是失误，一位曾与 AlphaGo 交过手的职业棋手说，他从没见过人类下出这样的棋。据 AlphaGo 自己估计，人类棋手下出这一步的概率，大约只有万分之一。

直到棋局推进下去，人们才明白，这一手是整盘棋的胜负关键。

那是人类第一次清楚地感受到：一个 AI 做出了人类当场看不懂的决定，而它是对的。

那一次，人类好歹在事后追上了。可现在的 AI 比当年的 AlphaGo 通用得多，它在写代码、做研究、分析问题，每天做出成千上万个决定。而《给足算力，AI 能无限聪明下去吗？》文章讲过，专门测量 AI 能力的研究机构已经发现，他们用人类任务做成的"尺子"，快要量不出最强模型的水平了。

AI 在变强，人类却没有。看不懂的时刻只会越来越多，事后追上的机会，只会越来越少。

## 二、真正的风险：看不懂意味着什么

也许有人会说：看不懂又怎样？我也看不懂计算器是怎么算出开平方的，照样天天用。

但计算器和 AI 有一个根本的区别。计算器的每一个零件，都有工程师彻底理解过；它算错了，我们也总能用别的方法核对出来。我们信任计算器，是因为在它背后，有人真正懂它。

AI 不是这样。当 AI 的能力超过所有人，它背后就不再有一个"真正懂它的人"了。

更要命的是 AlphaGo 那一手棋揭示的一件事：**在看不懂的人眼里，神之一手和一步昏招，长得一模一样。**解说们当时以为那是失误，他们没有办法当场区分"天才"和"错误"。

把这个道理放到 AI 身上，就很让人紧张了。当一个更高级的 AI 给你一份看不懂的方案，它可能是对的，是人类想不到的妙手；它也可能错了，错在一个你永远注意不到的地方；甚至，它可能是故意的，在你看不懂的地方藏了别的东西。而对于看不懂的你来说，这三种情况，看起来毫无区别。

医疗诊断、金融决策、科学研究、国家政策，AI 参与得越深，这个问题就越不能回避。所以，看不懂本身不是问题，**看不懂之后分不清对错，才是问题。**

那么，我们能不能努力一下，让自己跟上？

## 三、认知的极限：人类能否追上 AI

先想一个问题：一只狗，能不能学会微积分？

不能。但原因不是微积分对狗来说太难。难的东西，多花时间总能啃下来。真正的原因是，狗连"世界上存在微积分这种东西"都意识不到。它的整个概念世界里，根本没有容纳微积分的位置。

那么，人类面对更高级的 AI，会不会就像狗面对微积分？

人类的大脑确实有硬限制。心理学研究发现，我们的工作记忆一次只能抓住大约四样东西。试着在脑子里同时记住五个陌生的电话号码，就能感受到这堵墙。

但人类有一个狗没有的本事：我们会用纸和笔。

脑子里只能装四样东西，纸上却能写满一整本书。只要步骤清楚，一个人拿着纸笔，原则上可以执行任何计算，哪怕要算一辈子。所以有物理学家认为，人和狗不同，人原则上能理解一切可以被解释的东西，区别只在快慢。这听起来很鼓舞人心。

可这里有一个漏洞。

想象一个完全不懂中文的人，被关在一间屋子里。屋里有一本厚厚的规则手册，告诉他：收到这样的字符，就写下那样的字符。屋外的人递进中文纸条，收到的回复流畅得体，于是认定屋里坐着一位中文高手。可屋里的人自始至终一个中文字都不认识，他只是在照章办事。

这是哲学上著名的"中文屋"。它说明了一件事：**能执行，不等于能理解。**

一个人拿着纸笔，也许真能一步步手算完一个超级 AI 的全部运算，花上几十亿年。可算完之后，他手里只有一串结果，他仍然不知道这串结果为什么成立。

而且就算原则上能懂，如果懂一件事需要一万年，那对一个只能活八十年的人来说，懂与不懂还有什么区别？

理解，本质上是一种压缩。数学家不会去记每一步推导，他记住的是"导数"这样的概念，然后拿着概念去想更难的问题。我们能理解多复杂的东西，取决于能不能把它压缩进手里握得住的几个概念。一个比我们聪明得多的 AI，用来思考的概念，可能根本塞不进我们那只能装四样东西的脑子。

所以，这个问题的答案是：原则上也许能跟上，现实中跟不上。

那么，跟不上的话，是不是就只能盲目相信了？

## 四、验证的可能：不理解，能否判断对错

最直接的想法是：把 AI 打开，看看它里面到底在干什么。

可惜这条路在理论上就被堵死了。计算机科学早就证明，对于"一个程序最终会做什么"这类问题，不存在一种通用的方法能对所有程序给出判断。想靠检查一个足够强大的系统本身来确认它可靠，在一般情况下是做不到的。

直接看不行，那还能怎么办？

先来做一道题。假设你是色盲，分不清红和绿。我手里有两个球，我告诉你：这两个球一红一绿，颜色不一样。你看过去，它们完全是一个颜色。

你怎么知道我有没有骗你？

先别急着往下看，想一想。

办法其实很简单。你把两个球藏到身后，自己偷偷决定换不换它们的左右位置，然后拿出来问我：换了没有？

如果两个球真的颜色不同，我一眼就能看出来，每次都能答对。如果它们其实是同一个颜色，我就和你一样分不清，只能瞎猜，猜对的机会只有一半。玩一轮我蒙对了，说明不了什么；连玩二十轮我次次都对，我在撒谎的可能性就不到百万分之一。

这道题的妙处在于：从头到尾，你都没有获得辨别颜色的能力，却可靠地验证了一个拥有这种能力的人。你依靠的不是能力，而是两样东西：**你手里有对方不知道的随机性，而且你可以提问。**

这不只是一个小把戏。计算机科学家后来把它发展成了一套严格的理论，并且证明：一个能力很弱的验证者，只要能和一个能力强大、但不一定诚实的对象反复问答，就能可靠地验证那些远远超出自己能力的问题。

如果被验证的对象有两个，而且被分开，互相不能通气，验证者的能力还会大得多。这就像警察分开审讯两个嫌疑人：一个人可以把故事编得天衣无缝，两个人分开编，细节就很难对得上。

所以这个问题的答案，出乎意料地乐观：**判断一个答案对不对，未必需要比答案更聪明，需要的是会提问。**

可是，谜题里行得通的办法，放到现实里还行得通吗？

## 五、现实的缺口：验证机制是否可靠

受这个思路启发，AI 安全研究者提出过一个方案：让两个 AI 就同一个问题展开辩论，一个论证，一个挑错，由人类当裁判。理论上可以证明，在理想条件下，一个能力有限的裁判，通过这样的辩论，也能判断那些远超自己能力的问题。

这听起来很新，其实人类社会用它已经用了几百年。法庭上的法官和陪审团，大多不是法医、会计或工程师，却要对专业问题做出裁决。他们靠的，正是让控辩双方互相质询，把破绽逼出来。

可是，法庭也会判错。它会在哪里判错？

第一，问题说不清的时候。色盲谜题能解，是因为"颜色是否相同"是一个明确的问题。可我们最想让 AI 帮忙判断的，往往是另一类问题："这个政策会不会带来好的结果？""这个方案对人类有没有害？"这类问题很难写成精确的规则，谜题里那套漂亮的办法，在这里就使不上劲了。

第二，嫌疑人串供的时候。分开审讯之所以有效，是因为两个嫌疑人没法商量。可如果两个嫌疑人是同一个人的两份拷贝，他们想的本来就一模一样，根本不需要商量，就能给出完全一致的说辞。同一个 AI 的多个副本，恰恰就是这样。

第三，错误被刻意藏起来的时候。设想有人递给你一份一万步的论证，并且你知道其中恰好有一步是错的。可一万步里，究竟是哪一步？如果错误被藏在一个极难检查的角落，诚实的一方就算知道对方在撒谎，也可能要付出多得多的代价，才能把错误揪出来。撒谎，往往比揭穿撒谎便宜。

第四，裁判本身的问题。裁判是人，人会累，会有偏见，会被更会说话的一方打动。谜题里的验证者只看对错，现实中的裁判，常常先看谁讲得好听。

研究者们正在设计新的规则来堵这些漏洞，也在理论上取得了一些进展，但这些规则能不能在真实的 AI 身上管用，目前还没有人知道。

所以这个问题的答案是：原理上可行，现实中还有很长的路要走。

## 六、人类的新位置：从解题者到出题者

回到开头的问题：当人类再也看不懂更高级的 AI，还能判断它说得对不对吗？

想到这里，答案变得清楚了一些。靠"看懂"来判断，这条路迟早会走到尽头；但判断对错，本来就不只有"看懂"这一条路。色盲看不见颜色，照样能揭穿关于颜色的谎言。

这也意味着，人类的位置正在悄悄改变。几千年来，人类是知识的理解者：一个结论被接受，是因为有人真正懂了它。而在更高级的 AI 面前，这个位置可能守不住了。人类或许要学着换一个位置：不再是那个解题的人，而是那个出题的人，那个设计规则、让错误和谎言无处藏身的人。

其实我们早就在这样生活了。病人看不懂医生的每一个判断，公民读不完所有的法律条文，我们一直依靠各种制度，去信任那些自己无法亲自检验的东西。只是这一次，站在对面的，可能比全人类加起来还要聪明。

面对更高级的 AI，人类要问的问题，也许不再是"我们看懂了吗"，而是"我们有没有办法检验它"。

还有一个问题，在这篇文章里一直没有回答。前面说，人和狗之间有一道鸿沟，人跨过了，狗没有。这道鸿沟究竟是什么？它刻在人类的基因里，还是另有来源？下一篇，我们来聊聊人类的特殊性，到底藏在哪里。

![](images/e7b136/img_001.png)

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。

如果你也在自己**跑模型、写代码、做项目**，

或者使用**Claude**和**Claude code**，

欢迎**点赞关注转发**一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/e7b136/img_002.jpg)
