龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

我们一直管它叫"语言大模型",但它可能只是个"文字大模型"

格里灰丝2026-04-20约 2890 字Markdown 原文

· · ·

今天参加一个会议,有人随口提了一句:我们现在用语音跟大模型对话,它其实不是在"听"你说话——它是先把你的声音转成文字,然后再去理解那段文字。

当时没人接这个话茬,会议继续往下开了。

但我回来以后一直在想这件事。

越想越觉得不对。越想越觉得这里面藏着一个很大的东西。

· · ·

先说一个数字。

一秒钟的高品质音频,数据量大约是 1.4 Mbps。同一秒的内容转成文字,大约是 200 bps。

中间的压缩比:大约七千倍。

我当时第一反应是:那丢掉的都是冗余吧?转成文字不是挺好的吗,该有的信息都有了。

但仔细一想,不对。七千倍的东西没了,没了的是什么?

是你的音色,你的语速,你句子中间那个不自觉的停顿,你说"没关系"时嘴角带出来的那一点勉强。送进大模型的只剩几个字。

这是一次信息的巨大丢失。但我后来意识到,这其实不是一次丢失。是两次。

· · ·

我们平时把"声音"和"语言"混在一起说,但它们其实是不同的东西。

声音是最底层的。它包含一切——环境里的风声、杯子放下的声音、远处有人在笑。声音是物理世界的震动。

语言是声音里用来人和人交流的那一部分。但语言不只是"说了什么",还有"怎么说的"。你说了什么,是语义。你怎么说的——你的语调、你的节奏、你气息的变化、你嘴角的笑意——这叫副语言。语言 = 语义 + 副语言。

文字只编码了语义。副语言在写下来的那一刻,几乎全丢了。

所以从声音到文字,压缩发生了两次:

声音 →(第一次)→ 语言:丢掉了环境音、音乐、所有非人声的部分。

语言 →(第二次)→ 文字:丢掉了语调、节奏、气息、情绪——也就是副语言。

文字保留的,只是语言的骨架。肉没了。

· · ·

想到这里我突然意识到一件事。

我们管现在的 AI 叫什么?

大语言模型。Large Language Model。

但它训练用的是什么?是文字。是书、是网页、是论文、是代码。它吃的是 text,处理的是 text,输出的也是 text。

那它不是"大语言模型"。它是大文字模型

这不是在抖机灵。Language 和 text 是两个东西。Language 里有一半信息在语调和节奏里,text 里没有。我们把一个只处理文字的系统叫"语言模型"——其实是我们自己已经习惯了把"语言"等同于"文字",连命名的时候都没觉得哪里不对。

但这个命名的错位,恰好暴露了一个真问题:

如果我们造出一个真正的"语言大模型"——一个不仅理解你说了什么,还理解你怎么说的模型——它会比现在的"文字大模型"多出什么?

· · ·

多出的那部分,到底是什么?

先说一个直觉上容易想到的:它会更懂你的意思。

同一句"你觉得呢",用不同语气说,意思完全不同。可以是真的在征求意见,可以是不耐烦,可以是撒娇,可以是冷战中的威胁。文字大模型面对这四个字只能猜上下文。但如果它能听到你的语调,根本不需要猜。

"我没事"——文字上看,没事就是没事。但声音里的那个颤,人类一听就知道有事。

"好的"——是真的好的,还是敷衍的好的?文字里读不出来,声音里一清二楚。

所以一个真正的语言大模型,在理解人的意图和状态上,会比文字大模型好一截。这个好像不难理解。

但真正有意思的不是这个。

· · ·

真正有意思的是——声音里藏着一些连说话的人自己都不知道的东西

科学家已经发现,从一个人的声音特征里——音高变化的幅度、语速、停顿的长度——可以检测到抑郁的早期信号。不是他说了"我很难过"才能判断,而是他的声音本身的物理特征就在透露。他自己可能还没意识到。

从咳嗽声里可以判断呼吸系统的状况。从说话的节奏变化里可以追踪认知退化的早期征兆。从声音频率的某些微妙波动里可以发现帕金森的前兆。

这些模式是什么?

它们不是"伤心""焦虑""疲惫"这些我们已经有的词。这些词是人类语言对情绪的粗略分类。而声音里藏着的那些模式,比这些词精细得多,也复杂得多——它们可能是几十个声学参数的某种组合,这种组合在人类的语言里没有对应的名字

换句话说:声音里有一些东西,不是"语言还没来得及命名",而是语言这种系统可能根本命名不了。就像你没办法用整数精确表示圆周率——不是整数还不够多,是整数这种格式就不适合装这种东西。

这才是真正超越语言的部分。

· · ·

那现在的 AI 到底走到哪了?

最新的情况是,已经有模型开始直接处理原始音频了,不再走"先转文字再理解"的老路。

Google 的 Gemini 系列已经能原生理解音频,它可以识别说话者的情绪语调,同样的话用不同方式说,模型会给出不同的回应。OpenAI 也推出了专门的语音到语音模型 gpt-realtime,音频进去直接出音频,中间不经过文字。

但有一个关键的"但是"。

这些原生音频能力,目前主要用在实时对话场景——语音助手、客服机器人、同声翻译。它们让对话更流畅、更自然、延迟更低。

但是,当你问一个需要深度推理的问题——比如"帮我分析一下这份财报"——模型内部的推理过程,底层还是在文字空间里进行的。音频是新加的输入通道,但思维的引擎还是那台文字机器。

所以现在的状态大概是:

一个文字大模型,正在学着用耳朵听——但它的大脑还是在用文字想。

就好比一个人天生只会读书面语,现在装上了助听器,能听到声音了。他比以前多知道了一些东西。但他理解世界的方式,还是文字的方式。

· · ·

那一个"真正的语言大模型"应该是什么样的?

我觉得,它不只是在输入端多一个麦克风。它应该让副语言信息——语调、节奏、气息——全程参与推理,而不只是在入口处多采集一种信号。

就像一个好的心理咨询师,她不是先把你说的话"转成文字"再分析,她是同时在听你说什么和怎么说的,这两者在她脑子里不是先后处理的,是交织在一起的。你话语的内容和你声音的质感,共同构成了她对你的理解。

如果有一天,大模型也能这样——不是"听到声音→转成文字→推理",而是声音和意义在模型内部同时、交融地被处理——那它可能真的能配得上"语言大模型"这个名字了。

而那个时候它理解的东西,可能会比现在多出一大块——那一块,就是人类五千年来写成文字时一直在丢掉的部分。

· · ·

回到开头那个会上的场景。

那个人只是随口说了一句:大模型不是在听你说话,是在读你说话的转录稿。

他说完就过去了。但我回来想了一路,越想越远,最后想到了这些:

第一,声音比文字大。 第二,我们嘴上叫"语言模型",手里造的是"文字模型"。 第三,如果有一天,大模型真的学会了"听",它听到的东西里,可能有一些是人类语言从来没有说出口的。

我不确定第三点什么时候会发生。

但这个方向本身,就很值得想一想。

· · ·

说起来,那个人在会上说这句话的时候,语气很随意,像是在说一个不重要的技术细节。但正是那种随意的语气让我没有当场追问——如果他当时语气郑重一点,也许我会在现场就接上这个话题。

你看,语气这个东西,真的会影响一句话的命运。

但如果你只看这句话的会议纪要,这些全都不存在。

上一篇搭Agent系统踩的坑,人类组织100年前就踩过了下一篇【深度】未来的Agent该是什么样的?