# 李飞飞写了篇世界模型分类，但世界模型还得先靠物理学家定义

> 龙虾AGI通用实验室 · 2026-06-05

李飞飞最近发了一篇文章，叫《世界模型的功能分类学》，试图回答一个看起来简单的问题：什么是世界模型？

文章有启发，分类也清晰。但读完之后我一直在想一件事：她分类的起点，是不是就选错了？

## 先说她讲了什么

李飞飞说，现在"世界模型"这个词太混乱了。视频生成说自己是世界模型，物理引擎说自己是世界模型，机器人也说自己是世界模型。她给出了一个分类框架，按照系统输出什么来分：

渲染器，输出像素，给你看一段逼真的视频。 模拟器，输出状态，告诉你世界在物理上变成了什么样。 规划器，输出动作，告诉机器人下一步该做什么。

清晰吗？清晰。有用吗？有用。

但我总觉得少了点什么。

## 那个不对劲的感觉

后来我想明白了。这个分类回答的不是"世界模型是什么"，而是"世界模型能做什么"。

打个比方。有人问"什么是厨师"，你回答"有的做中餐，有的做西餐，有的做甜点"。这没有错，但这不是定义厨师，这是在分类厨师的产出。听完之后你知道厨师能做什么菜了，但"厨师的本质是什么"这个问题，其实被巧妙地绕过去了。

李飞飞的分类也是一样。她按照"输出什么"来分，像素、状态、动作。但她跳过了一个更基础的问题：

## 世界本身是由什么构成的？

你不先回答这个，怎么知道一个模型有没有"理解"世界？

## 试着回答那个被跳过的问题

那就来试试。如果让你用最少的词来描述物理世界的一切，你会怎么说？

我想了很久，觉得答案可能是四个词：**时间、空间、物质、力。**

空间，是世界的"舞台"。三维的、连续的，物体在其中有形状、有位置、有遮挡关系。

时间，是世界的"进程"。事情有先后、有快慢、有持续。同一个鸡蛋在沸水里煮五分钟和五小时，结果完全不一样。

物质，是世界的"角色"。不同的东西有不同的属性，玻璃是脆的，橡胶有弹性，水会流动。这些属性决定了物质受力时怎么反应。

力，是世界的"情节"。没有力，世界就是一张静止的画面。重力让东西掉落，摩擦力让鞋子不打滑，碰撞力让玻璃碎裂。有了力，世界才开始"发生"。

你可能会问：就这四个吗？生物呢？社会呢？文化呢？

我想了想，这些确实是世界的一部分，但它们不是新的基本维度，而是这四个维度在更高层次上的组合和涌现。而且更关键的是，当前 AI 通过语言和多模态训练，对生物、社会、文化这些层面的知识已经掌握了很多。真正缺的东西，不在那些层面。

真正缺的，恰恰就在这四根最基础的柱子上。

## 等等，大模型不是已经"知道"物理了吗？

你可能觉得不对。你问 ChatGPT 或者 Claude "把杯子推到桌边会怎么样"，它回答得头头是道：杯子会掉落，如果是玻璃的可能会碎。它明明知道物理啊？

这就是最微妙的地方。

它确实"知道"。但这个"知道"是什么性质的？

想象一个人，他把一本游泳教材背得滚瓜烂熟。他能告诉你蛙泳的每一个技术要点：手臂怎么划、腿怎么蹬、什么时候换气。他甚至能给别人纠正动作，"你的蹬腿时机不对，应该在手臂回收的时候蹬"。

但是把他扔进水里，他可能直接沉下去。

## 背书和会游泳是两种完全不同的"知道"。

大语言模型对物理世界的"知道"，更接近背书。它知道"杯子掉了会碎"，是因为训练数据里有无数次"杯子""掉落""碎裂"的文本共现。它学会了这些词之间的统计关联。

但它脑子里没有一个三维的杯子，没有一张桌子，没有重力。它没有办法在内部"运行"一遍杯子掉落的过程，从滑动到倾斜、到掉落、到碰地、到碎裂、到碎片飞散。

你的大脑可以。你闭上眼就能"看到"这个过程，虽然你可能从来没学过牛顿力学。你的大脑里跑的不是一段关于重力的课文，而是某种空间性的、动态的、连续的内部模拟。

如果要给这个区别起个名字的话：大语言模型有的是**命题性知识**（能用语言陈述的事实），缺的是**操作性表征**（能在内部运行的动态模型）。

这就是"谈论世界"和"运行世界"的区别。

## 那么到底缺了什么？

现在可以把两个思路合在一起了。

我们说世界由时间、空间、物质、力构成。大语言模型对这四样东西都有命题性知识，但都缺少操作性表征。具体来说：

关于空间，语言是一维的符号序列。"杯子在桌上"这五个字，丢失了杯子的形状、体积、精确位置、与桌边的距离，几乎丢失了一切空间信息。模型需要的是在内部直接"拥有"三维空间，而不是把空间翻译成文字。

关于时间，语言模型的"时间"是一个 token 接一个 token，离散的、匀速的。但杯子掉落是零点几秒，铁锈蔓延是几个月。真实的时间是连续的，有快有慢。模型需要能在内部"运行"一段过程，而不是一步跳到结果。

关于物质，模型知道"玻璃是脆的"，但这只是一个语言标签。真正的世界模型需要这个"脆"是一个可计算的物理参数（比如断裂韧性），能直接参与受力分析，而不是作为一个形容词等着被"理解"。

关于力，模型知道"推杯子它会动"。但如果你问"用多大的力、从什么角度推、在什么材质的桌面上、杯子会移动多远、会不会翻倒"，它就开始编了。从"知道 A 导致 B"到"能算出 A 以什么程度导致 B"，这个跨越还没有发生。

你发现了吗？这四道鸿沟有一个共同的深层模式：**都是从离散的、符号化的表征，到连续的、可运行的表征的跨越。**

语言天生是离散的，它把连续的世界切成一个一个的词。而物理世界是连续的，空间是连续的，时间是连续的，力是连续的，物质属性是连续的。用离散的符号去描述连续的世界，中间必然有系统性的信息丢失。不管你的模型多大、数据多多，这个结构性的鸿沟不会因为规模而消失。

## 那视频模型呢？视频不是连续的吗？

好问题。视频确实比语言丰富得多，有空间信息、有时间信息、有物体运动的连续过程。Sora 能生成一段杯子掉落碎裂的逼真视频，这不就是在"运行"世界吗？

还是差一步。

视频是世界的二维投影。它记录的是"看起来像什么"，不是"实际是什么"。被遮挡的部分消失了，深度信息被压扁了。而且最关键的是，视频记录的是相关性，不是因果性。

举个例子：视频里一个铁球"自己"滚了起来。为什么？也许桌子下面藏了一块磁铁。但你从视频像素里看不到磁铁，你只看到球动了。视频给你的是结果，不是原因。

所以 Sora 那类模型学到的是：掉落的杯子后面，在像素层面，通常跟着碎片的画面。这是一条很好的视觉规律，足以生成逼真的视频。但"玻璃材质 + 碰撞力 > 断裂阈值 → 破碎"这条因果链，不在像素统计里。

这也是李飞飞文章里最精彩的一个说法。她说一个渲染器生成的城市航拍看起来完美无缺，但你试着开车穿过那个城市，建筑就崩塌了。因为渲染器只需要"看起来对"，不需要"实际上对"。

## 所以终局是什么？

回到最开始的问题：世界模型到底是什么？

经过这一圈思考，我觉得可以给出一个比李飞飞的分类更底层的回答：

**世界模型是一个系统对时间、空间、物质、力及其耦合关系的操作性内部表征，使得它能够在内部"运行"世界的动态过程，而非仅仅"谈论"世界的静态事实。**

渲染、模拟、规划不是三种不同的世界模型，而是同一个世界模型的三种不同"读出方式"。向人眼读出就是渲染，向物理引擎读出就是模拟，向执行器读出就是规划。就像你脑中对客厅的那个模型，可以用来想象画面、预测杯子掉落、也可以规划走路路线，底层是同一个东西。

当前的研究是零散的：计算机视觉做 3D 重建，机器人学做运动规划，物理引擎做流体模拟。各做各的。但这些方向最终大概率会汇合，不是因为乐观，而是因为世界本身就是统一的。做渲染做到极致需要物理，做物理做到极致需要几何，做规划做到极致需要两者。起点不同，但终局应该一样。

大语言模型会是这条路的起点吗？也许。它已经拥有了人类知识中关于世界的大量命题性描述，这是一笔巨大的资产。但它还需要跨过那道从"谈论"到"运行"的鸿沟，从离散到连续，从符号到表征，从描述到模拟。

这大概是 AI 接下来最重要的一段路。不是让模型说得更好，而是让模型在内心深处，真正拥有一个可以运行的世界。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/a0e292/img_001.jpg)
