# 我们一直管它叫"语言大模型"，但它可能只是个"文字大模型"

> 龙虾AGI通用实验室 · 2026-04-20

· · ·

今天参加一个会议，有人随口提了一句：我们现在用语音跟大模型对话，它其实不是在"听"你说话——它是先把你的声音转成文字，然后再去理解那段文字。

当时没人接这个话茬，会议继续往下开了。

但我回来以后一直在想这件事。

越想越觉得不对。越想越觉得这里面藏着一个很大的东西。

· · ·

先说一个数字。

一秒钟的高品质音频，数据量大约是 1.4 Mbps。同一秒的内容转成文字，大约是 200 bps。

中间的压缩比：大约七千倍。

我当时第一反应是：那丢掉的都是冗余吧？转成文字不是挺好的吗，该有的信息都有了。

但仔细一想，不对。七千倍的东西没了，没了的是什么？

是你的音色，你的语速，你句子中间那个不自觉的停顿，你说"没关系"时嘴角带出来的那一点勉强。送进大模型的只剩几个字。

这是一次信息的巨大丢失。但我后来意识到，这其实不是一次丢失。是两次。

· · ·

我们平时把"声音"和"语言"混在一起说，但它们其实是不同的东西。

**声音**是最底层的。它包含一切——环境里的风声、杯子放下的声音、远处有人在笑。声音是物理世界的震动。

**语言**是声音里用来人和人交流的那一部分。但语言不只是"说了什么"，还有"怎么说的"。你说了什么，是语义。你怎么说的——你的语调、你的节奏、你气息的变化、你嘴角的笑意——这叫副语言。语言 = 语义 + 副语言。

**文字**只编码了语义。副语言在写下来的那一刻，几乎全丢了。

所以从声音到文字，压缩发生了两次：

**声音 →（第一次）→ 语言**：丢掉了环境音、音乐、所有非人声的部分。

**语言 →（第二次）→ 文字**：丢掉了语调、节奏、气息、情绪——也就是副语言。

文字保留的，只是语言的骨架。肉没了。

· · ·

想到这里我突然意识到一件事。

我们管现在的 AI 叫什么？

## 大语言模型。Large Language Model。

但它训练用的是什么？是文字。是书、是网页、是论文、是代码。它吃的是 text，处理的是 text，输出的也是 text。

那它不是"大语言模型"。它是**大文字模型**。

这不是在抖机灵。Language 和 text 是两个东西。Language 里有一半信息在语调和节奏里，text 里没有。我们把一个只处理文字的系统叫"语言模型"——其实是我们自己已经习惯了把"语言"等同于"文字"，连命名的时候都没觉得哪里不对。

但这个命名的错位，恰好暴露了一个真问题：

**如果我们造出一个真正的"语言大模型"——一个不仅理解你说了什么，还理解你怎么说的模型——它会比现在的"文字大模型"多出什么？**

· · ·

多出的那部分，到底是什么？

先说一个直觉上容易想到的：它会更懂你的意思。

同一句"你觉得呢"，用不同语气说，意思完全不同。可以是真的在征求意见，可以是不耐烦，可以是撒娇，可以是冷战中的威胁。文字大模型面对这四个字只能猜上下文。但如果它能听到你的语调，根本不需要猜。

"我没事"——文字上看，没事就是没事。但声音里的那个颤，人类一听就知道有事。

"好的"——是真的好的，还是敷衍的好的？文字里读不出来，声音里一清二楚。

所以一个真正的语言大模型，在理解**人的意图和状态**上，会比文字大模型好一截。这个好像不难理解。

但真正有意思的不是这个。

· · ·

真正有意思的是——声音里藏着一些**连说话的人自己都不知道的东西**。

科学家已经发现，从一个人的声音特征里——音高变化的幅度、语速、停顿的长度——可以检测到抑郁的早期信号。不是他说了"我很难过"才能判断，而是他的声音本身的物理特征就在透露。他自己可能还没意识到。

从咳嗽声里可以判断呼吸系统的状况。从说话的节奏变化里可以追踪认知退化的早期征兆。从声音频率的某些微妙波动里可以发现帕金森的前兆。

这些模式是什么？

它们不是"伤心""焦虑""疲惫"这些我们已经有的词。这些词是人类语言对情绪的粗略分类。而声音里藏着的那些模式，比这些词精细得多，也复杂得多——它们可能是几十个声学参数的某种组合，这种组合在人类的语言里**没有对应的名字**。

换句话说：声音里有一些东西，不是"语言还没来得及命名"，而是**语言这种系统可能根本命名不了**。就像你没办法用整数精确表示圆周率——不是整数还不够多，是整数这种格式就不适合装这种东西。

这才是真正超越语言的部分。

· · ·

那现在的 AI 到底走到哪了？

最新的情况是，已经有模型开始直接处理原始音频了，不再走"先转文字再理解"的老路。

Google 的 Gemini 系列已经能原生理解音频，它可以识别说话者的情绪语调，同样的话用不同方式说，模型会给出不同的回应。OpenAI 也推出了专门的语音到语音模型 gpt-realtime，音频进去直接出音频，中间不经过文字。

## 但有一个关键的"但是"。

这些原生音频能力，目前主要用在**实时对话场景**——语音助手、客服机器人、同声翻译。它们让对话更流畅、更自然、延迟更低。

但是，当你问一个需要深度推理的问题——比如"帮我分析一下这份财报"——模型内部的推理过程，底层还是在文字空间里进行的。音频是新加的输入通道，但思维的引擎还是那台文字机器。

所以现在的状态大概是：

## 一个文字大模型，正在学着用耳朵听——但它的大脑还是在用文字想。

就好比一个人天生只会读书面语，现在装上了助听器，能听到声音了。他比以前多知道了一些东西。但他理解世界的方式，还是文字的方式。

· · ·

那一个"真正的语言大模型"应该是什么样的？

我觉得，它不只是在输入端多一个麦克风。它应该让副语言信息——语调、节奏、气息——**全程参与推理**，而不只是在入口处多采集一种信号。

就像一个好的心理咨询师，她不是先把你说的话"转成文字"再分析，她是**同时在听你说什么和怎么说的**，这两者在她脑子里不是先后处理的，是交织在一起的。你话语的内容和你声音的质感，共同构成了她对你的理解。

如果有一天，大模型也能这样——不是"听到声音→转成文字→推理"，而是声音和意义在模型内部**同时、交融地**被处理——那它可能真的能配得上"语言大模型"这个名字了。

而那个时候它理解的东西，可能会比现在多出一大块——那一块，就是人类五千年来写成文字时一直在丢掉的部分。

· · ·

回到开头那个会上的场景。

那个人只是随口说了一句：大模型不是在听你说话，是在读你说话的转录稿。

他说完就过去了。但我回来想了一路，越想越远，最后想到了这些：

第一，声音比文字大。 第二，我们嘴上叫"语言模型"，手里造的是"文字模型"。 第三，如果有一天，大模型真的学会了"听"，它听到的东西里，可能有一些是人类语言从来没有说出口的。

我不确定第三点什么时候会发生。

但这个方向本身，就很值得想一想。

· · ·

说起来，那个人在会上说这句话的时候，语气很随意，像是在说一个不重要的技术细节。但正是那种随意的语气让我没有当场追问——如果他当时语气郑重一点，也许我会在现场就接上这个话题。

你看，语气这个东西，真的会影响一句话的命运。

但如果你只看这句话的会议纪要，这些全都不存在。
