# 用中文问 AI 和用英文问 AI，效果一样吗？

> 龙虾AGI通用实验室 · 2026-07-27

## 关于 Token 的认知，你大概率是错的

很多人对大模型有一个根深蒂固的认知：AI 不懂语言，它只懂 token。所以理论上，用中文提问和用英文提问，效果应该一样，反正在模型眼里都是一串数字，对吧？

我以前也这么想。直到真正搞清楚 token 到底是什么，我才意识到，这个看似合理的直觉，从根上就是错的。而且错得很有意思，它不是错在结论上，而是错在前提上。Token 不是大多数人以为的那个东西。这个前提一旦修正，后面会连锁地改变你对大模型很多问题的理解：为什么中文和英文效果不一样，为什么训练数据需要精心配比，甚至为什么"模型越大越聪明"这件事本身也有一个很少被讨论的隐含条件。

· · ·

## Token 不是"最小语义单位"

先纠正最常见的误解。

很多科普文章把 token 解释为"最小的语义单位"，给人一种感觉：AI 像人一样先理解词义，再理解句意。"苹果"是一个 token，"好吃"是一个 token，模型把它们拼起来理解"苹果好吃"。

但真实的情况完全不是这样。Token 跟语义没有任何关系。它是一种基于统计频率的文本压缩方案。

现在主流大模型用的分词算法叫 BPE（Byte Pair Encoding，字节对编码）。它的工作原理出人意料地朴素：

**第一步，** 把所有文本打碎成最小的单位，也就是字节。在英文里就是单个字母，在中文里是 UTF-8 编码的字节（一个汉字占 3 个字节）。

**第二步，** 统计整个训练语料库里，哪两个相邻的字节最经常一起出现。把它们合并成一个新的 token。

**第三步，** 重复第二步，不断合并高频的相邻组合，直到词表达到预设的大小（通常几万到十几万个 token）。

就这样。没有语法分析，没有词义理解，纯粹是数频率、做合并。

这意味着什么？

英文单词 "understanding" 在模型眼里可能不是一个 token，而是被切成了 "under" + "stand" + "ing" 三个 token。不是因为它有三层含义，而是因为 BPE 算法发现这三个碎片各自在英文中反复大量出现，把它们分别收录进词表比把 "understanding" 整个收录更高效。

"the""is""and" 这些超高频短词通常整个就是一个 token。而不常见的专有名词比如 "Anthropic" 可能被切成 "Anth" + "rop" + "ic"。

换句话说，**token 的边界不是语义边界，而是统计边界。** 一个 token 可能是一个完整的词，也可能是半个词，也可能是一个词根、一个后缀，甚至只是几个字母。这完全取决于这个片段在训练语料中出现的频率。

理解了这一点，后面的事情就开始变得有趣了。

· · ·

## 英文是 BPE 的"亲儿子"

BPE 算法有一个很少被提及但影响深远的特性：它天然偏爱字母文字，尤其是英文。

英文有一组天然优势。26 个字母的组合空间很小，常用单词大多由少量字母构成。而且英文有大量反复出现的词根、前缀和后缀（un-、re-、pre-、-ing、-tion、-ment），这些高频碎片极易被 BPE 合并成 token。结果就是，英文的 token 化效率非常高，每个 token 平均能携带相当多的语义信息。

中文面对 BPE 时的处境则完全不同。

中文是表意文字，常用汉字就有三四千个，加上不常用的上万个。每个汉字在 UTF-8 编码中占 3 个字节。而 tokenizer 的词表大小是固定的，通常就十来万个位置，还要同时容纳英文、中文、法文、日文以及其他所有语言。

想象一下，词表就像一本字典，总共只能收录十来万个词条。英文的基本零件很少（26 个字母），通过组合就能高效地覆盖大量单词，少量的词条就能编码海量的英文内容。但中文的基本零件本身就有几千个（常用汉字），光是给每个常用汉字分配一个词条，就已经占掉了词表的很大一块空间。留给"学习""人工智能"这类多字词组合并成单个词条的余量就很少了。

结果就是：英文的词条以高频碎片为主，每个碎片可以参与大量单词的拼装，复用率极高。中文的词条则被大量单字占据，每个字只能代表它自己，复用率很低。

具体来看，常用汉字比如"的""是""在"，因为在语料中出现频率极高，每个字可以独占一个 token，这没问题。一些常见的双字词比如"学习""模型"，在某些 tokenizer 中可能被合并为一个 token，但也可能还是两个，取决于词表还有没有多余的容量分配给它们。

而那些不常见的字，比如"骉""犇""翀"，因为在训练语料中出现次数太少，BPE 根本没有机会把它们的 3 个 UTF-8 字节合并成一个 token。于是，一个人类看来只是"一个字"的东西，在模型眼里被拆成了两三个毫无意义的字节碎片。

这个底层的编码不平等，会一路传导上去，产生一系列你可能没想到的后果。

· · ·

## 同样的意思，中文要交更多"税"

来看一个直观的例子。

英文："Machine learning is a subset of artificial intelligence."中文："机器学习是人工智能的一个子集。"

这两句话表达完全相同的意思。但英文版本大约消耗 8 到 10 个 token，中文版本可能消耗 10 到 13 个 token。因为几乎每个汉字都是一个独立的 token，而英文的多个单词可以共享词根和词缀。

表面上看，多几个 token 好像没什么大不了。但放到大模型的实际运行中，这个差异会层层放大。

**第一层放大：上下文窗口的不平等。** 大模型的上下文窗口是按 token 数量计算的，不是按"信息量"计算的。如果一个模型的上下文窗口是 128K token，你用英文能塞进去的内容就是比中文多出 20% 到 30%。这意味着用中文做长文档分析、多轮对话、复杂推理时，你的"工作空间"天然就比英文用户小。

**第二层放大：训练效率的不平等。** 模型训练时是按 token 处理的。同样一篇论文，中文版本切出来的 token 序列更长，模型要花更多的计算步数来处理相同的信息。在固定训练预算下，模型每"读"一个 token 学到的信息量，中文天然就比英文少。

**第三层放大：成本的不平等。** API 调用是按 token 计费的。表达同样的意思，中文用户要付更多的钱。这不是定价歧视，而是 tokenizer 的编码效率差异直接转化成了经济成本。

这三层放大叠加在一起，意味着中文用户在使用大模型时承受着一种隐性的、系统性的"语言税"。不是因为模型故意歧视中文，而是因为整个技术栈从最底层的编码方式开始，就对中文不够友好。

· · ·

## 训练数据的配比：另一种"看不见的手"

如果说 tokenizer 是第一层不平等，那训练数据的配比就是第二层。

大模型的预训练数据不是把所有能找到的文本一股脑塞进去就行的。代码、数学、中文、英文、科学论文、网页、书籍，不同类型的数据按什么比例混合，直接决定模型最终在各项能力上的表现。这个配比需要通过大量实验来摸索，是模型训练中最重要的"秘方"之一。

直觉上，你可能会觉得：既然模型内部都是 token，数据配比应该不影响最终的理解能力吧？就像一个人不管先学数学还是先学语文，最终的智商应该是一样的？

但事实恰恰相反。配比对结果的影响是巨大且不可逆的。

原因在于，模型的"能力"不是凭空长出来的，而是从训练数据中蒸馏出来的。如果训练数据中 80% 是英文网页，模型会非常擅长英文写作，但中文可能差一截。如果代码数据占比很高，模型的编程和逻辑推理能力会很强，但闲聊可能变得生硬。

更微妙的是，不同类型的数据之间存在正向迁移和负向干扰。代码数据往往能提升推理能力，因为代码本身就是结构化的逻辑表达。数学数据能增强模型的严谨性。但大量低质量的闲聊数据可能会"稀释"模型好不容易从代码和数学中学到的推理能力。

这就像一个学生的课程表。不是说你学的科目越多就越好。如果你一学期 80% 的时间在上体育课，你的数学成绩不会因为"反正脑子是同一个"就自动变好。大脑是同一个没错，但这个大脑的能力分配是由你怎么训练它决定的。

而对于中文来说，这里面又藏着一个更深层的困境：互联网上高质量的中文文本总量远远少于英文。英文维基百科有 680 多万篇文章，中文只有 130 多万篇。学术论文、技术文档、优质书籍在英文中的数量更是碾压性的领先。

这意味着，即使模型开发者有意愿提高中文的数据配比，他们也面临着"巧妇难为无米之炊"的困境：高质量中文数据就那么多，你想多放也没得放。

于是，tokenizer 层面的编码不平等和数据层面的供给不平等形成了双重叠加。模型在中文上的表现不如英文，不是因为某一个环节出了问题，而是从最底层的编码到最上层的数据供给，每一层都在系统性地"亏待"中文。

· · ·

## 等一下，既然都是 token，那语言差异不应该存在才对？

读到这里，你可能注意到一个矛盾。

前面说模型只看 token，不看语言。那按这个逻辑，模型根本不知道什么是"中文"什么是"英文"，在它眼里一切都是 token 序列。那为什么中文和英文的效果还是不一样呢？模型难道不是应该对所有 token 一视同仁吗？

这个问题问得很对，而且它的答案恰好揭示了一个关于大模型很深层的真相。

模型确实对所有 token 一视同仁。它不知道哪些 token 属于中文，哪些属于英文。但问题不在于模型"歧视"某种语言，而在于不同语言的 token 在训练过程中获得的学习机会是严重不均等的。

什么叫"学习机会"？模型学习的方式是预测下一个 token。每遇到一个 token 序列，它就尝试预测后面是什么，猜对了就强化，猜错了就调整。一个 token 模式在训练数据中出现的次数越多，模型对这个模式的理解就越深，相关的预测就越准确。

英文 token 序列在训练数据中出现的频次远高于中文。这不是模型的选择，是数据现实决定的。模型只是忠实地反映了训练数据中的分布：英文模式见得多，学得深；中文模式见得少，学得浅。

所以答案是：模型没有偏见，但它的训练数据有偏。模型对所有 token 确实一视同仁，但不同语言的 token 在训练中获得的"练习次数"天差地别。

这就引出了一个自然的追问：这种差异是不是仅仅因为模型还没"学透"？如果给它足够多的中文数据，让它在中文上也练习足够多次，差距是不是就能完全消除？

· · ·

## 学透了，差距就能消失吗？

答案分两层。

第一层：大部分差距确实是因为"没学透"，可以缩小。

大模型有一个令人惊讶的特性。尽管它只是在学 token 之间的统计关系，但在足够大的数据和足够大的模型上，它似乎自发地在内部形成了一种"语言无关"的知识表征层。你用英文教它牛顿第三定律，然后用中文问它相关的问题，它能回答。你用中文给它讲一个数学定理，它能用日文解释这个定理。

这说明，模型内部的知识不是以某一种特定语言的 token 形式存储的，而是在更深的某一层被抽象成了一种跨语言的表征。就像一个真正的多语言者，他脑子里"重力加速度是 9.8 m/s²"这个知识不是以英文或中文存储的，而是以某种更抽象的概念形式存在的，需要用哪种语言输出时再"翻译"过去。

随着模型越来越大、中文数据越来越多，这种跨语言迁移能力在增强，中文和英文之间的差距确实在缩小。在事实性知识和逻辑推理方面，差距已经很小了。

但第二层更有意思：即使"学透"了，有些差异也不会消失。

不同语言之间不存在完美的一一映射。每一种语言都是一套独特的认知框架，它不只是给同样的事物贴了不同的标签，它实际上切分现实的方式就不一样。俄语对蓝色有两个基本词（深蓝 siniy 和浅蓝 goluboy），说俄语的人区分蓝色色调的速度确实比说英语的人快。日语有"木漏れ日"这个词，专门描述阳光透过树叶缝隙洒下的光影，英文里没有对应的单词。不是因为英语使用者没见过这种光影，而是他们的语言没有为这种体验单独命名。

"缘分""江湖""面子"这些中文概念背后承载的文化含义，只存在于中文的语料之中。如果模型没有见过足够多讨论这些概念的中文文本，它就无法真正理解它们。而这种理解不是跨语言迁移能解决的，你不可能从英文数据中"迁移"出对"江湖"的理解。

这意味着，每一种语言的文本中都包含着一些"只能用这种语言才能精确表达"的信息。要"学透"中文，你不能只靠翻译英文材料，你必须从中文原始文本中学习那些中文独有的认知方式。

所以更准确的表述可能是：随着模型规模和数据量的增长，不同语种之间的效果差距会持续缩小，在事实性知识和逻辑推理方面可能趋近于零。但在文化理解、语感、表达的精妙性方面，差距不会完全消失。因为这不是模型"没学好"的问题，而是语言本身就不是彼此的完美翻译。

就像一个真正的人类双语者，他用母语思考时的那种自如和精准，用第二语言时总是差那么一点。那个"差一点"不是因为他第二语言没学好，而是因为两种语言本就引导着不同的思维方式。

当我们问"AI 说中文和说英文有没有区别"时，答案不只是技术层面的（tokenizer 效率不同、数据量不同），它还触及了一个更深的问题：语言是否只是思想的容器，还是思想本身的一部分。

如果语言只是容器，那学透了就没区别。如果语言是思想的一部分，那"没区别"这个状态本身就不存在。

目前的证据更倾向于后者。

· · ·

## 这意味着什么

回到开头的问题：你用中文问 AI 和用英文问 AI，效果一样吗？

现在你知道了，不一样。而且这个"不一样"是从最底层的字节编码一路传导到最上层的文化理解，层层叠加的结果。

但我觉得这篇文章真正值得带走的洞察不是"中文吃亏了"这个结论。而是一个更根本的认知修正：**Token 不是语义的原子，而是统计的产物。** 它的边界不反映意义的边界，它的效率不反映语言的复杂度，它的分布不反映知识的价值。

当我们说"大模型只懂 token"时，这句话的含义比大多数人意识到的更深刻，也更让人不安。它意味着，模型对世界的理解是通过一个有偏的、不平等的压缩方案来中介的。这个方案对不同的语言、不同的文化、不同的知识领域，给予了不同的"带宽"。

AI 并不是在一个平坦的空间里平等地学习所有语言。它是在一个被 tokenizer 扭曲过的空间里学习的。有些语言在这个空间里被"放大"了，有些被"压缩"了。这种扭曲发生在如此底层、如此隐蔽的地方，以至于大多数人，包括很多从业者，根本意识不到它的存在。

意识到它的存在，是理解大模型真实能力和局限的第一步。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，或者使用Claude和Claude code，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/7a1997/img_001.jpg)
