龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

用中文问 AI 和用英文问 AI,效果一样吗?

格里灰丝2026-07-27约 6110 字Markdown 原文

关于 Token 的认知,你大概率是错的

很多人对大模型有一个根深蒂固的认知:AI 不懂语言,它只懂 token。所以理论上,用中文提问和用英文提问,效果应该一样,反正在模型眼里都是一串数字,对吧?

我以前也这么想。直到真正搞清楚 token 到底是什么,我才意识到,这个看似合理的直觉,从根上就是错的。而且错得很有意思,它不是错在结论上,而是错在前提上。Token 不是大多数人以为的那个东西。这个前提一旦修正,后面会连锁地改变你对大模型很多问题的理解:为什么中文和英文效果不一样,为什么训练数据需要精心配比,甚至为什么"模型越大越聪明"这件事本身也有一个很少被讨论的隐含条件。

· · ·

Token 不是"最小语义单位"

先纠正最常见的误解。

很多科普文章把 token 解释为"最小的语义单位",给人一种感觉:AI 像人一样先理解词义,再理解句意。"苹果"是一个 token,"好吃"是一个 token,模型把它们拼起来理解"苹果好吃"。

但真实的情况完全不是这样。Token 跟语义没有任何关系。它是一种基于统计频率的文本压缩方案。

现在主流大模型用的分词算法叫 BPE(Byte Pair Encoding,字节对编码)。它的工作原理出人意料地朴素:

第一步, 把所有文本打碎成最小的单位,也就是字节。在英文里就是单个字母,在中文里是 UTF-8 编码的字节(一个汉字占 3 个字节)。

第二步, 统计整个训练语料库里,哪两个相邻的字节最经常一起出现。把它们合并成一个新的 token。

第三步, 重复第二步,不断合并高频的相邻组合,直到词表达到预设的大小(通常几万到十几万个 token)。

就这样。没有语法分析,没有词义理解,纯粹是数频率、做合并。

这意味着什么?

英文单词 "understanding" 在模型眼里可能不是一个 token,而是被切成了 "under" + "stand" + "ing" 三个 token。不是因为它有三层含义,而是因为 BPE 算法发现这三个碎片各自在英文中反复大量出现,把它们分别收录进词表比把 "understanding" 整个收录更高效。

"the""is""and" 这些超高频短词通常整个就是一个 token。而不常见的专有名词比如 "Anthropic" 可能被切成 "Anth" + "rop" + "ic"。

换句话说,token 的边界不是语义边界,而是统计边界。 一个 token 可能是一个完整的词,也可能是半个词,也可能是一个词根、一个后缀,甚至只是几个字母。这完全取决于这个片段在训练语料中出现的频率。

理解了这一点,后面的事情就开始变得有趣了。

· · ·

英文是 BPE 的"亲儿子"

BPE 算法有一个很少被提及但影响深远的特性:它天然偏爱字母文字,尤其是英文。

英文有一组天然优势。26 个字母的组合空间很小,常用单词大多由少量字母构成。而且英文有大量反复出现的词根、前缀和后缀(un-、re-、pre-、-ing、-tion、-ment),这些高频碎片极易被 BPE 合并成 token。结果就是,英文的 token 化效率非常高,每个 token 平均能携带相当多的语义信息。

中文面对 BPE 时的处境则完全不同。

中文是表意文字,常用汉字就有三四千个,加上不常用的上万个。每个汉字在 UTF-8 编码中占 3 个字节。而 tokenizer 的词表大小是固定的,通常就十来万个位置,还要同时容纳英文、中文、法文、日文以及其他所有语言。

想象一下,词表就像一本字典,总共只能收录十来万个词条。英文的基本零件很少(26 个字母),通过组合就能高效地覆盖大量单词,少量的词条就能编码海量的英文内容。但中文的基本零件本身就有几千个(常用汉字),光是给每个常用汉字分配一个词条,就已经占掉了词表的很大一块空间。留给"学习""人工智能"这类多字词组合并成单个词条的余量就很少了。

结果就是:英文的词条以高频碎片为主,每个碎片可以参与大量单词的拼装,复用率极高。中文的词条则被大量单字占据,每个字只能代表它自己,复用率很低。

具体来看,常用汉字比如"的""是""在",因为在语料中出现频率极高,每个字可以独占一个 token,这没问题。一些常见的双字词比如"学习""模型",在某些 tokenizer 中可能被合并为一个 token,但也可能还是两个,取决于词表还有没有多余的容量分配给它们。

而那些不常见的字,比如"骉""犇""翀",因为在训练语料中出现次数太少,BPE 根本没有机会把它们的 3 个 UTF-8 字节合并成一个 token。于是,一个人类看来只是"一个字"的东西,在模型眼里被拆成了两三个毫无意义的字节碎片。

这个底层的编码不平等,会一路传导上去,产生一系列你可能没想到的后果。

· · ·

同样的意思,中文要交更多"税"

来看一个直观的例子。

英文:"Machine learning is a subset of artificial intelligence."中文:"机器学习是人工智能的一个子集。"

这两句话表达完全相同的意思。但英文版本大约消耗 8 到 10 个 token,中文版本可能消耗 10 到 13 个 token。因为几乎每个汉字都是一个独立的 token,而英文的多个单词可以共享词根和词缀。

表面上看,多几个 token 好像没什么大不了。但放到大模型的实际运行中,这个差异会层层放大。

第一层放大:上下文窗口的不平等。 大模型的上下文窗口是按 token 数量计算的,不是按"信息量"计算的。如果一个模型的上下文窗口是 128K token,你用英文能塞进去的内容就是比中文多出 20% 到 30%。这意味着用中文做长文档分析、多轮对话、复杂推理时,你的"工作空间"天然就比英文用户小。

第二层放大:训练效率的不平等。 模型训练时是按 token 处理的。同样一篇论文,中文版本切出来的 token 序列更长,模型要花更多的计算步数来处理相同的信息。在固定训练预算下,模型每"读"一个 token 学到的信息量,中文天然就比英文少。

第三层放大:成本的不平等。 API 调用是按 token 计费的。表达同样的意思,中文用户要付更多的钱。这不是定价歧视,而是 tokenizer 的编码效率差异直接转化成了经济成本。

这三层放大叠加在一起,意味着中文用户在使用大模型时承受着一种隐性的、系统性的"语言税"。不是因为模型故意歧视中文,而是因为整个技术栈从最底层的编码方式开始,就对中文不够友好。

· · ·

训练数据的配比:另一种"看不见的手"

如果说 tokenizer 是第一层不平等,那训练数据的配比就是第二层。

大模型的预训练数据不是把所有能找到的文本一股脑塞进去就行的。代码、数学、中文、英文、科学论文、网页、书籍,不同类型的数据按什么比例混合,直接决定模型最终在各项能力上的表现。这个配比需要通过大量实验来摸索,是模型训练中最重要的"秘方"之一。

直觉上,你可能会觉得:既然模型内部都是 token,数据配比应该不影响最终的理解能力吧?就像一个人不管先学数学还是先学语文,最终的智商应该是一样的?

但事实恰恰相反。配比对结果的影响是巨大且不可逆的。

原因在于,模型的"能力"不是凭空长出来的,而是从训练数据中蒸馏出来的。如果训练数据中 80% 是英文网页,模型会非常擅长英文写作,但中文可能差一截。如果代码数据占比很高,模型的编程和逻辑推理能力会很强,但闲聊可能变得生硬。

更微妙的是,不同类型的数据之间存在正向迁移和负向干扰。代码数据往往能提升推理能力,因为代码本身就是结构化的逻辑表达。数学数据能增强模型的严谨性。但大量低质量的闲聊数据可能会"稀释"模型好不容易从代码和数学中学到的推理能力。

这就像一个学生的课程表。不是说你学的科目越多就越好。如果你一学期 80% 的时间在上体育课,你的数学成绩不会因为"反正脑子是同一个"就自动变好。大脑是同一个没错,但这个大脑的能力分配是由你怎么训练它决定的。

而对于中文来说,这里面又藏着一个更深层的困境:互联网上高质量的中文文本总量远远少于英文。英文维基百科有 680 多万篇文章,中文只有 130 多万篇。学术论文、技术文档、优质书籍在英文中的数量更是碾压性的领先。

这意味着,即使模型开发者有意愿提高中文的数据配比,他们也面临着"巧妇难为无米之炊"的困境:高质量中文数据就那么多,你想多放也没得放。

于是,tokenizer 层面的编码不平等和数据层面的供给不平等形成了双重叠加。模型在中文上的表现不如英文,不是因为某一个环节出了问题,而是从最底层的编码到最上层的数据供给,每一层都在系统性地"亏待"中文。

· · ·

等一下,既然都是 token,那语言差异不应该存在才对?

读到这里,你可能注意到一个矛盾。

前面说模型只看 token,不看语言。那按这个逻辑,模型根本不知道什么是"中文"什么是"英文",在它眼里一切都是 token 序列。那为什么中文和英文的效果还是不一样呢?模型难道不是应该对所有 token 一视同仁吗?

这个问题问得很对,而且它的答案恰好揭示了一个关于大模型很深层的真相。

模型确实对所有 token 一视同仁。它不知道哪些 token 属于中文,哪些属于英文。但问题不在于模型"歧视"某种语言,而在于不同语言的 token 在训练过程中获得的学习机会是严重不均等的。

什么叫"学习机会"?模型学习的方式是预测下一个 token。每遇到一个 token 序列,它就尝试预测后面是什么,猜对了就强化,猜错了就调整。一个 token 模式在训练数据中出现的次数越多,模型对这个模式的理解就越深,相关的预测就越准确。

英文 token 序列在训练数据中出现的频次远高于中文。这不是模型的选择,是数据现实决定的。模型只是忠实地反映了训练数据中的分布:英文模式见得多,学得深;中文模式见得少,学得浅。

所以答案是:模型没有偏见,但它的训练数据有偏。模型对所有 token 确实一视同仁,但不同语言的 token 在训练中获得的"练习次数"天差地别。

这就引出了一个自然的追问:这种差异是不是仅仅因为模型还没"学透"?如果给它足够多的中文数据,让它在中文上也练习足够多次,差距是不是就能完全消除?

· · ·

学透了,差距就能消失吗?

答案分两层。

第一层:大部分差距确实是因为"没学透",可以缩小。

大模型有一个令人惊讶的特性。尽管它只是在学 token 之间的统计关系,但在足够大的数据和足够大的模型上,它似乎自发地在内部形成了一种"语言无关"的知识表征层。你用英文教它牛顿第三定律,然后用中文问它相关的问题,它能回答。你用中文给它讲一个数学定理,它能用日文解释这个定理。

这说明,模型内部的知识不是以某一种特定语言的 token 形式存储的,而是在更深的某一层被抽象成了一种跨语言的表征。就像一个真正的多语言者,他脑子里"重力加速度是 9.8 m/s²"这个知识不是以英文或中文存储的,而是以某种更抽象的概念形式存在的,需要用哪种语言输出时再"翻译"过去。

随着模型越来越大、中文数据越来越多,这种跨语言迁移能力在增强,中文和英文之间的差距确实在缩小。在事实性知识和逻辑推理方面,差距已经很小了。

但第二层更有意思:即使"学透"了,有些差异也不会消失。

不同语言之间不存在完美的一一映射。每一种语言都是一套独特的认知框架,它不只是给同样的事物贴了不同的标签,它实际上切分现实的方式就不一样。俄语对蓝色有两个基本词(深蓝 siniy 和浅蓝 goluboy),说俄语的人区分蓝色色调的速度确实比说英语的人快。日语有"木漏れ日"这个词,专门描述阳光透过树叶缝隙洒下的光影,英文里没有对应的单词。不是因为英语使用者没见过这种光影,而是他们的语言没有为这种体验单独命名。

"缘分""江湖""面子"这些中文概念背后承载的文化含义,只存在于中文的语料之中。如果模型没有见过足够多讨论这些概念的中文文本,它就无法真正理解它们。而这种理解不是跨语言迁移能解决的,你不可能从英文数据中"迁移"出对"江湖"的理解。

这意味着,每一种语言的文本中都包含着一些"只能用这种语言才能精确表达"的信息。要"学透"中文,你不能只靠翻译英文材料,你必须从中文原始文本中学习那些中文独有的认知方式。

所以更准确的表述可能是:随着模型规模和数据量的增长,不同语种之间的效果差距会持续缩小,在事实性知识和逻辑推理方面可能趋近于零。但在文化理解、语感、表达的精妙性方面,差距不会完全消失。因为这不是模型"没学好"的问题,而是语言本身就不是彼此的完美翻译。

就像一个真正的人类双语者,他用母语思考时的那种自如和精准,用第二语言时总是差那么一点。那个"差一点"不是因为他第二语言没学好,而是因为两种语言本就引导着不同的思维方式。

当我们问"AI 说中文和说英文有没有区别"时,答案不只是技术层面的(tokenizer 效率不同、数据量不同),它还触及了一个更深的问题:语言是否只是思想的容器,还是思想本身的一部分。

如果语言只是容器,那学透了就没区别。如果语言是思想的一部分,那"没区别"这个状态本身就不存在。

目前的证据更倾向于后者。

· · ·

这意味着什么

回到开头的问题:你用中文问 AI 和用英文问 AI,效果一样吗?

现在你知道了,不一样。而且这个"不一样"是从最底层的字节编码一路传导到最上层的文化理解,层层叠加的结果。

但我觉得这篇文章真正值得带走的洞察不是"中文吃亏了"这个结论。而是一个更根本的认知修正:Token 不是语义的原子,而是统计的产物。 它的边界不反映意义的边界,它的效率不反映语言的复杂度,它的分布不反映知识的价值。

当我们说"大模型只懂 token"时,这句话的含义比大多数人意识到的更深刻,也更让人不安。它意味着,模型对世界的理解是通过一个有偏的、不平等的压缩方案来中介的。这个方案对不同的语言、不同的文化、不同的知识领域,给予了不同的"带宽"。

AI 并不是在一个平坦的空间里平等地学习所有语言。它是在一个被 tokenizer 扭曲过的空间里学习的。有些语言在这个空间里被"放大"了,有些被"压缩"了。这种扭曲发生在如此底层、如此隐蔽的地方,以至于大多数人,包括很多从业者,根本意识不到它的存在。

意识到它的存在,是理解大模型真实能力和局限的第一步。


我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,或者使用Claude和Claude code,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。

上一篇一个关于 AI 训练数据的反直觉真相下一篇用文言文跟 AI 交流,真的省 token 吗?