用 Claude Opus 5.5 越久,我心里有一个念头就越清晰:它给我的很多东西,我其实已经没法完全检查了。
它说一段代码没问题,我大致看得懂思路,但真要逐行确认每个细节,我做不到。它把一个复杂问题分析得头头是道,我觉得有道理,可如果让我说出它哪里可能错了,我也说不上来。我之所以接受,很大程度上是因为它以前大多是对的。
这不只是一个普通用户的处境。今天,一个普通人已经很难逐一核验 AI 的输出,但至少还有专家可以把关。可 AI 的能力还在快速提升,终有一天,面对它的将是人类最顶尖的专家,甚至是全人类的集体智慧,而连他们也跟不上了。
到那时,人类作为一个整体,还能判断 AI 说得对不对吗?
这篇文章想顺着这个问题,把它拆开,一层一层想清楚。
一、理解的失守:人类是否终将看不懂 AI
答案是会,而且已经开始了。
2016 年,AlphaGo 与李世石对弈的第二局,第 37 手,AlphaGo 把棋子落在了一个让所有职业棋手都困惑的位置。现场解说一度以为是失误,一位曾与 AlphaGo 交过手的职业棋手说,他从没见过人类下出这样的棋。据 AlphaGo 自己估计,人类棋手下出这一步的概率,大约只有万分之一。
直到棋局推进下去,人们才明白,这一手是整盘棋的胜负关键。
那是人类第一次清楚地感受到:一个 AI 做出了人类当场看不懂的决定,而它是对的。
那一次,人类好歹在事后追上了。可现在的 AI 比当年的 AlphaGo 通用得多,它在写代码、做研究、分析问题,每天做出成千上万个决定。而《给足算力,AI 能无限聪明下去吗?》文章讲过,专门测量 AI 能力的研究机构已经发现,他们用人类任务做成的"尺子",快要量不出最强模型的水平了。
AI 在变强,人类却没有。看不懂的时刻只会越来越多,事后追上的机会,只会越来越少。
二、真正的风险:看不懂意味着什么
也许有人会说:看不懂又怎样?我也看不懂计算器是怎么算出开平方的,照样天天用。
但计算器和 AI 有一个根本的区别。计算器的每一个零件,都有工程师彻底理解过;它算错了,我们也总能用别的方法核对出来。我们信任计算器,是因为在它背后,有人真正懂它。
AI 不是这样。当 AI 的能力超过所有人,它背后就不再有一个"真正懂它的人"了。
更要命的是 AlphaGo 那一手棋揭示的一件事:在看不懂的人眼里,神之一手和一步昏招,长得一模一样。解说们当时以为那是失误,他们没有办法当场区分"天才"和"错误"。
把这个道理放到 AI 身上,就很让人紧张了。当一个更高级的 AI 给你一份看不懂的方案,它可能是对的,是人类想不到的妙手;它也可能错了,错在一个你永远注意不到的地方;甚至,它可能是故意的,在你看不懂的地方藏了别的东西。而对于看不懂的你来说,这三种情况,看起来毫无区别。
医疗诊断、金融决策、科学研究、国家政策,AI 参与得越深,这个问题就越不能回避。所以,看不懂本身不是问题,看不懂之后分不清对错,才是问题。
那么,我们能不能努力一下,让自己跟上?
三、认知的极限:人类能否追上 AI
先想一个问题:一只狗,能不能学会微积分?
不能。但原因不是微积分对狗来说太难。难的东西,多花时间总能啃下来。真正的原因是,狗连"世界上存在微积分这种东西"都意识不到。它的整个概念世界里,根本没有容纳微积分的位置。
那么,人类面对更高级的 AI,会不会就像狗面对微积分?
人类的大脑确实有硬限制。心理学研究发现,我们的工作记忆一次只能抓住大约四样东西。试着在脑子里同时记住五个陌生的电话号码,就能感受到这堵墙。
但人类有一个狗没有的本事:我们会用纸和笔。
脑子里只能装四样东西,纸上却能写满一整本书。只要步骤清楚,一个人拿着纸笔,原则上可以执行任何计算,哪怕要算一辈子。所以有物理学家认为,人和狗不同,人原则上能理解一切可以被解释的东西,区别只在快慢。这听起来很鼓舞人心。
可这里有一个漏洞。
想象一个完全不懂中文的人,被关在一间屋子里。屋里有一本厚厚的规则手册,告诉他:收到这样的字符,就写下那样的字符。屋外的人递进中文纸条,收到的回复流畅得体,于是认定屋里坐着一位中文高手。可屋里的人自始至终一个中文字都不认识,他只是在照章办事。
这是哲学上著名的"中文屋"。它说明了一件事:能执行,不等于能理解。
一个人拿着纸笔,也许真能一步步手算完一个超级 AI 的全部运算,花上几十亿年。可算完之后,他手里只有一串结果,他仍然不知道这串结果为什么成立。
而且就算原则上能懂,如果懂一件事需要一万年,那对一个只能活八十年的人来说,懂与不懂还有什么区别?
理解,本质上是一种压缩。数学家不会去记每一步推导,他记住的是"导数"这样的概念,然后拿着概念去想更难的问题。我们能理解多复杂的东西,取决于能不能把它压缩进手里握得住的几个概念。一个比我们聪明得多的 AI,用来思考的概念,可能根本塞不进我们那只能装四样东西的脑子。
所以,这个问题的答案是:原则上也许能跟上,现实中跟不上。
那么,跟不上的话,是不是就只能盲目相信了?
四、验证的可能:不理解,能否判断对错
最直接的想法是:把 AI 打开,看看它里面到底在干什么。
可惜这条路在理论上就被堵死了。计算机科学早就证明,对于"一个程序最终会做什么"这类问题,不存在一种通用的方法能对所有程序给出判断。想靠检查一个足够强大的系统本身来确认它可靠,在一般情况下是做不到的。
直接看不行,那还能怎么办?
先来做一道题。假设你是色盲,分不清红和绿。我手里有两个球,我告诉你:这两个球一红一绿,颜色不一样。你看过去,它们完全是一个颜色。
你怎么知道我有没有骗你?
先别急着往下看,想一想。
办法其实很简单。你把两个球藏到身后,自己偷偷决定换不换它们的左右位置,然后拿出来问我:换了没有?
如果两个球真的颜色不同,我一眼就能看出来,每次都能答对。如果它们其实是同一个颜色,我就和你一样分不清,只能瞎猜,猜对的机会只有一半。玩一轮我蒙对了,说明不了什么;连玩二十轮我次次都对,我在撒谎的可能性就不到百万分之一。
这道题的妙处在于:从头到尾,你都没有获得辨别颜色的能力,却可靠地验证了一个拥有这种能力的人。你依靠的不是能力,而是两样东西:你手里有对方不知道的随机性,而且你可以提问。
这不只是一个小把戏。计算机科学家后来把它发展成了一套严格的理论,并且证明:一个能力很弱的验证者,只要能和一个能力强大、但不一定诚实的对象反复问答,就能可靠地验证那些远远超出自己能力的问题。
如果被验证的对象有两个,而且被分开,互相不能通气,验证者的能力还会大得多。这就像警察分开审讯两个嫌疑人:一个人可以把故事编得天衣无缝,两个人分开编,细节就很难对得上。
所以这个问题的答案,出乎意料地乐观:判断一个答案对不对,未必需要比答案更聪明,需要的是会提问。
可是,谜题里行得通的办法,放到现实里还行得通吗?
五、现实的缺口:验证机制是否可靠
受这个思路启发,AI 安全研究者提出过一个方案:让两个 AI 就同一个问题展开辩论,一个论证,一个挑错,由人类当裁判。理论上可以证明,在理想条件下,一个能力有限的裁判,通过这样的辩论,也能判断那些远超自己能力的问题。
这听起来很新,其实人类社会用它已经用了几百年。法庭上的法官和陪审团,大多不是法医、会计或工程师,却要对专业问题做出裁决。他们靠的,正是让控辩双方互相质询,把破绽逼出来。
可是,法庭也会判错。它会在哪里判错?
第一,问题说不清的时候。色盲谜题能解,是因为"颜色是否相同"是一个明确的问题。可我们最想让 AI 帮忙判断的,往往是另一类问题:"这个政策会不会带来好的结果?""这个方案对人类有没有害?"这类问题很难写成精确的规则,谜题里那套漂亮的办法,在这里就使不上劲了。
第二,嫌疑人串供的时候。分开审讯之所以有效,是因为两个嫌疑人没法商量。可如果两个嫌疑人是同一个人的两份拷贝,他们想的本来就一模一样,根本不需要商量,就能给出完全一致的说辞。同一个 AI 的多个副本,恰恰就是这样。
第三,错误被刻意藏起来的时候。设想有人递给你一份一万步的论证,并且你知道其中恰好有一步是错的。可一万步里,究竟是哪一步?如果错误被藏在一个极难检查的角落,诚实的一方就算知道对方在撒谎,也可能要付出多得多的代价,才能把错误揪出来。撒谎,往往比揭穿撒谎便宜。
第四,裁判本身的问题。裁判是人,人会累,会有偏见,会被更会说话的一方打动。谜题里的验证者只看对错,现实中的裁判,常常先看谁讲得好听。
研究者们正在设计新的规则来堵这些漏洞,也在理论上取得了一些进展,但这些规则能不能在真实的 AI 身上管用,目前还没有人知道。
所以这个问题的答案是:原理上可行,现实中还有很长的路要走。
六、人类的新位置:从解题者到出题者
回到开头的问题:当人类再也看不懂更高级的 AI,还能判断它说得对不对吗?
想到这里,答案变得清楚了一些。靠"看懂"来判断,这条路迟早会走到尽头;但判断对错,本来就不只有"看懂"这一条路。色盲看不见颜色,照样能揭穿关于颜色的谎言。
这也意味着,人类的位置正在悄悄改变。几千年来,人类是知识的理解者:一个结论被接受,是因为有人真正懂了它。而在更高级的 AI 面前,这个位置可能守不住了。人类或许要学着换一个位置:不再是那个解题的人,而是那个出题的人,那个设计规则、让错误和谎言无处藏身的人。
其实我们早就在这样生活了。病人看不懂医生的每一个判断,公民读不完所有的法律条文,我们一直依靠各种制度,去信任那些自己无法亲自检验的东西。只是这一次,站在对面的,可能比全人类加起来还要聪明。
面对更高级的 AI,人类要问的问题,也许不再是"我们看懂了吗",而是"我们有没有办法检验它"。
还有一个问题,在这篇文章里一直没有回答。前面说,人和狗之间有一道鸿沟,人跨过了,狗没有。这道鸿沟究竟是什么?它刻在人类的基因里,还是另有来源?下一篇,我们来聊聊人类的特殊性,到底藏在哪里。

如果你也在自己跑模型、写代码、做项目,
或者使用Claude和Claude code,
欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。
