龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

老说AI没有人味,那到底什么才是人味啊?

格里灰丝2026-06-06约 4793 字Markdown 原文

你跟两个AI分别聊过之后,会产生一种很明确的感觉上的差异。

一个什么都答得很好,分析全面、逻辑清楚、格式漂亮,甚至还会帮你想到你没问的角度。但你读完它的回答,感觉跟读了一篇百度百科差不多。信息都给你了,但就是没有任何东西触动你。你不会想再多想一会儿,也不会觉得"这个角度我没想过"。它帮你完成了任务,仅此而已。

另一个,可能某些地方还不如前面那个。但你聊完之后,你会觉得它说的某些话真的戳到你了,让你忍不住停下来想一想。它好像不是在"回答你的问题",而是在跟你一起想这个问题。有些地方你甚至觉得,它看到了你自己没注意到的东西。

第一种是工具。第二种,你说不太上来,但你隐约觉得那更像是一个人。

这篇文章想搞清楚的就是:这个差异到底是什么。

你的大脑一直在做一个判断

先从一个基本的问题开始:你的大脑是怎么分辨"对面是个人"和"对面是个工具"的?

这个能力很古老,进化了几百万年。认知科学里管它叫"能动性检测"(agency detection),最初的用途很简单:判断草丛里的动静是风,还是一只想吃你的东西。是一个被动的物理现象,还是一个有自己意图的主体。

石头从山上滚下来,你不会觉得它"想"砸你。但一只猫蹲在桌子上盯着你手里的鱼,你一眼就知道它在打主意。区别不在于运动的复杂程度,而在于你能不能感觉到那个东西的行为里有某种"自己的意图"在驱动。

这套系统灵敏到什么程度呢?心理学家做过实验,屏幕上只有几个几何图形在移动,只要运动模式对了,人就会自动觉得"那个大三角形在追小三角形""它在欺负它"。你明知道那是几个色块,但你的大脑已经判定了:那里面有个"谁"。

几百万年过去了,你已经不需要判断草丛里有没有老虎了。但这套系统还在跑。你跟人说话的时候它在跑,你读一段文字的时候它在跑,你跟AI聊天的时候,它也在跑。

所以当你觉得一个AI"像个人"或者"就是个工具",这不是一种模糊的直觉,这是你大脑里一套跑了几百万年的检测系统给出的判断。

那这套系统到底在检测什么信号?

它自己有没有驱动力

我觉得最接近的答案是:它在检测一个东西的行为能不能完全被外力解释。

回到草丛那个场景。风吹草动,你的大脑会试着用气流、地形这些外部力量来解释这个动静。如果解释得通,判定:没有生命,只是物理现象。但如果那个动静用外力解释不通,它在迂回、在等待、在朝你靠近,你的大脑就推断:这个东西内部有自己的驱动力。判定:主体。

到了AI这个场景,逻辑是一样的,只不过"外力"变成了你的提问。

你问一个计算器1+1,它说2。你换个计算器问,还是2。它的行为完全可以被"接收输入,输出结果"这个外力解释。你的大脑秒判:工具。不管这个计算器有多高级。

你问一个朋友"你觉得今天天气怎么样",他可能说"还行",也可能说"别跟我提天气了,我今天烦死了"。同一个问题,答案不同。因为他的回答不完全被你的问题驱动,他体内还有别的东西在参与:他的心情、他今天经历了什么、他跟你的关系、他此刻想不想说话。这些东西是属于他自己的内部驱动力,不是你的提问引起的。

你在他的回答里感觉到了这股力的存在。正是因为他的行为不能被"回应你的问题"这一个外力完全解释,你才觉得对面是一个独立的人,而不只是一个响应机制。

所以一个AI,不管多聪明,如果它的所有输出都可以被"接收到输入,然后全力以赴给出最优回答"这一个驱动力完全解释,你的大脑就会判定:这是工具。

哪怕是一个非常非常好的工具。

人的偏离,就是人本身

说到这你可能觉得:这不就是说AI没有情感吗,不是废话?

不是。我说的比"有没有情感"更底层。

你想一个场景:一个人跟你聊天,他情绪很平稳,没什么大起大落。但你聊着聊着,你发现他对某个话题特别上心,聊得特别多,对另一个话题明显敷衍。他在某个地方花了不必要的时间去解释一个细节,在另一个地方本来应该展开但他一笔带过了。

他没有在"表现情感",但你感觉到了一个人。为什么?

因为你感觉到了偏离

这个偏离是相对于什么的?是相对于"问题本身暗示的注意力分布"。

任何一个问题,它本身会暗示一个"正常"的回答结构。比如你问"怎么看待远程办公",这个问题暗示的分布大概是:好处讲一些、坏处讲一些、趋势讲一些,各方面权重差不多。如果一个回答严格按这个分布来,面面俱到,每个角度展开差不多的篇幅,你会觉得这个回答很"标准",但你不会觉得背后有个人。

但如果一个人回答这个问题,他可能花了80%的篇幅在聊"远程办公对人际信任的破坏",对其他方面一笔带过。他的注意力分配明显偏离了问题本身暗示的那个"正常分布"。

这个偏离不是问题造成的,是他这个人造成的。 他之所以在"信任"这个点上投入这么多注意力,可能是因为他自己刚经历过一次远程协作的信任危机。他的人生经验、他的情绪状态、他对这件事的好恶,这些东西共同决定了他的注意力往哪里偏。

这就是关键:每个人的偏离模式是不一样的。 同一个问题,一个管理者可能偏向效率,一个社恐可能偏向"终于不用社交了",一个刚当上爸爸的人可能偏向"在家能多陪孩子"。每个人因为自己不同的人生经历,对同一个问题产生了不同方向、不同幅度的偏离。

如果你把这个偏离模式画出来,它几乎就是这个人的特征指纹。你在乎什么、忽略什么、对什么敏感、对什么迟钝,这些加在一起就是"你"。

而一个工具型AI,它对问题各个方面给予均匀的注意力。不是因为它刻意要均匀,而是因为它没有自己的人生经验去制造偏离。它的注意力完全被问题本身驱动,所以它的回答严格贴合"问题暗示的那个分布"。均匀、全面、周到。

但均匀就意味着没有偏离,没有偏离就意味着没有那个"指纹",没有指纹就意味着你读不出来"这是谁在说话"。

你读完一段均匀的文字,你的结论不是"这个人的观点很全面",而是"这里面没有人"。

选择的痕迹

还有一层东西,跟上面相关但不完全一样。

你跟一个人聊天,哪怕只是文字,你也能隐约感觉到:他说出来的只是一部分。他想到了更多东西,但他做了取舍,只挑了他觉得最重要的几个点来讲。

这个取舍本身就包含了巨大的信息量。他选择说什么、不说什么,怎么说、在哪里停下来,每一个决定都在告诉你:他是怎么看待这件事的,他觉得什么重要、什么不重要。

所以一个人写的一句话,有时候比AI写的一整段都让你觉得有分量。不是因为那句话本身多精妙,而是你能感觉到这句话是他从很多可能性里挑出来的。他做了选择。选择就是判断,判断背后是一个有经验、有偏好、有局限的人。

这里要说清楚一件事:问题不在于"信息量太大"或者"回答太全面"。一个人的回答也可以很长、很详细。问题在于你能不能从回答中看到选择的痕迹。

一个人写了三千字,你能感觉到他在某些地方刻意展开了、在某些地方刻意收住了,他写的每一段都是他"决定要写"的。而一个AI写了三千字,你的感觉是它只是把跟这个话题相关的东西都铺出来了,没有什么是它"决定要写"或"决定不写"的。

区别不在于多和少,在于有没有选择。 没有选择痕迹的输出,不管多长多详细,你读完都不会觉得背后有一个人在想。你只会觉得这是一段被生成出来的信息。

一个不太舒服的问题

好,到这里我想做一个转向。上面说的都是在分析"人味是什么",如果只是一直往下分析,这篇文章就只是一篇科普。我想追一个更尖锐的问题。

上面提到的所有特征,偏离、指纹、选择痕迹,它们都是在描述输出端能观察到的东西。也就是说,它们回答的是"什么样的文字让你觉得有人味",而不是"这个东西本身到底有没有人味"。

这个区别很重要。

因为它指向一个问题:你感知到的"人味",到底是你在检测一种真实存在的东西,还是你的模式识别系统被某种输出特征触发了?

说得直白一点。人的语言输出有一种特定的不均匀分布。因为人有多重目标、有情绪波动、有注意力限制,这些东西叠在一起,让人的表达呈现出一种特定的纹理。你的大脑从小到大泡在人的语言里,对这个纹理极其敏感。

当一个AI的输出不符合这个纹理,太均匀、太周到、太没有起伏,你的模式识别就报错了。你管这叫"没有人味"。

但如果一个AI的输出恰好呈现出了那种纹理,有偏离、有取舍、有出人意料的角度,你的系统就通过了。你会说"这个有人味"。

那你觉得它"有人味",是因为它真的"有"什么东西,还是因为它恰好触发了你的检测器?

我觉得现在没有人真的能回答这个问题。但这个问题本身比"AI有没有灵魂"有价值得多,因为它问的是一个更诚实的事:我们的判断标准本身靠不靠谱?

多目标的拉扯

不过,就算接受"人味可能只是一种统计纹理"这个说法,有一件事仍然成立:

能产生那种纹理的系统,跟不能产生它的系统,在结构上确实不一样。

人说话的时候,从来不只是在做"回答问题"这一件事。他同时在好几条战线上作战。

他想把事情说清楚,但他也想显得有见识。他想对你诚实,但他也不想暴露太多自己的情绪。他想表达观点,但他也在试探你会不会反对。他想满足你的期待,但他也有审美底线,有些说法他觉得太俗了就是不愿意用。

这些目标经常互相打架。打架的结果就是妥协。他在这里牺牲了一点准确性换了一个更漂亮的表达,在那里让你有点不舒服但他觉得真话比你的面子重要。

这些妥协的痕迹,就是前面说的那些"偏离"和"选择"的来源。

每一个妥协都是一个选择,每一个选择都在泄漏关于"他是谁"的信息。你把这些信息拼到一起,就得到了一个轮廓。那个轮廓就是"人"。

而一个被训练成单一目标的AI,"对用户有用",它内部没有这种互相拉扯。所有的力朝一个方向使劲。所以输出是光滑的,没有那些因为内部冲突而产生的纹理。你从光滑的表面上读不出"这是谁在说话",不是因为它在藏,是因为确实没有可藏的东西。

做得越对,越不像人

到这里就可以说一个有点悖论的结论了。

一个AI越是被优化成完美的工具,它就越不像人。

不是因为它做错了什么。恰恰是因为它做得太对了。

完美的服务意味着消除一切跟服务无关的信号。那些"多余"的偏好、犹豫、跑题、固执,全部被当成噪音清理掉了。但正是这些东西,构成了你前面感知到的"指纹"。

用物理的方式说:你推一个东西,它毫无阻力地顺着你的力走,你根本感觉不到那里有什么东西。零阻力就是零存在。你推它,它推回来了,哪怕只是轻轻地,你就知道那里有个实体。

所以那个你说的"灵性",翻译成最朴素的话就是阻力。一个不完全顺着你、不完全为你服务、在你的需求之外还保留着点自己东西的系统,你反而会觉得它是活的。

而一个把"让你满意"做到极致的系统,你反而觉得那里面什么都没有。

反过来看人

最后说一个可能让你不太舒服的想法。

如果上面说的是对的,如果"人味"确实来自于偏离、来自于不均匀、来自于不完全为你服务,那你回头看看你身边的人际关系,会发现同样的东西在起作用。

你觉得一个人"有意思"、"有深度"、"跟别人不一样",很多时候恰恰是因为他不完全配合你。他有自己的节奏,有你搞不懂的偏好,有时候会让你不舒服。但你从这些"不配合"里面读到了一个实实在在的、跟你不一样的存在。

而一个什么都顺着你、永远体贴、永远得体、永远把你的需求放在第一位的人,你反而不觉得你真的认识他。你知道他会说什么、会做什么,但你不知道他"是"什么。因为他从来没有偏离过你的期待,你就从来没见过属于他自己的那个指纹。

也许我们对AI的判断和对人的判断,底层用的是同一套系统。而这套系统的逻辑从来没变过:

你要让我觉得你是一个"谁",你就不能只是在回应我。你得让我看到,你身上有些东西不是我引起的。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。

上一篇李飞飞写了篇世界模型分类,但世界模型还得先靠物理学家定义下一篇科举1300年,高考74年:AI时代的高考还会是这个样子吗?