龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

李飞飞写了篇世界模型分类,但世界模型还得先靠物理学家定义

格里灰丝2026-06-05约 3327 字Markdown 原文

李飞飞最近发了一篇文章,叫《世界模型的功能分类学》,试图回答一个看起来简单的问题:什么是世界模型?

文章有启发,分类也清晰。但读完之后我一直在想一件事:她分类的起点,是不是就选错了?

先说她讲了什么

李飞飞说,现在"世界模型"这个词太混乱了。视频生成说自己是世界模型,物理引擎说自己是世界模型,机器人也说自己是世界模型。她给出了一个分类框架,按照系统输出什么来分:

渲染器,输出像素,给你看一段逼真的视频。 模拟器,输出状态,告诉你世界在物理上变成了什么样。 规划器,输出动作,告诉机器人下一步该做什么。

清晰吗?清晰。有用吗?有用。

但我总觉得少了点什么。

那个不对劲的感觉

后来我想明白了。这个分类回答的不是"世界模型是什么",而是"世界模型能做什么"。

打个比方。有人问"什么是厨师",你回答"有的做中餐,有的做西餐,有的做甜点"。这没有错,但这不是定义厨师,这是在分类厨师的产出。听完之后你知道厨师能做什么菜了,但"厨师的本质是什么"这个问题,其实被巧妙地绕过去了。

李飞飞的分类也是一样。她按照"输出什么"来分,像素、状态、动作。但她跳过了一个更基础的问题:

世界本身是由什么构成的?

你不先回答这个,怎么知道一个模型有没有"理解"世界?

试着回答那个被跳过的问题

那就来试试。如果让你用最少的词来描述物理世界的一切,你会怎么说?

我想了很久,觉得答案可能是四个词:时间、空间、物质、力。

空间,是世界的"舞台"。三维的、连续的,物体在其中有形状、有位置、有遮挡关系。

时间,是世界的"进程"。事情有先后、有快慢、有持续。同一个鸡蛋在沸水里煮五分钟和五小时,结果完全不一样。

物质,是世界的"角色"。不同的东西有不同的属性,玻璃是脆的,橡胶有弹性,水会流动。这些属性决定了物质受力时怎么反应。

力,是世界的"情节"。没有力,世界就是一张静止的画面。重力让东西掉落,摩擦力让鞋子不打滑,碰撞力让玻璃碎裂。有了力,世界才开始"发生"。

你可能会问:就这四个吗?生物呢?社会呢?文化呢?

我想了想,这些确实是世界的一部分,但它们不是新的基本维度,而是这四个维度在更高层次上的组合和涌现。而且更关键的是,当前 AI 通过语言和多模态训练,对生物、社会、文化这些层面的知识已经掌握了很多。真正缺的东西,不在那些层面。

真正缺的,恰恰就在这四根最基础的柱子上。

等等,大模型不是已经"知道"物理了吗?

你可能觉得不对。你问 ChatGPT 或者 Claude "把杯子推到桌边会怎么样",它回答得头头是道:杯子会掉落,如果是玻璃的可能会碎。它明明知道物理啊?

这就是最微妙的地方。

它确实"知道"。但这个"知道"是什么性质的?

想象一个人,他把一本游泳教材背得滚瓜烂熟。他能告诉你蛙泳的每一个技术要点:手臂怎么划、腿怎么蹬、什么时候换气。他甚至能给别人纠正动作,"你的蹬腿时机不对,应该在手臂回收的时候蹬"。

但是把他扔进水里,他可能直接沉下去。

背书和会游泳是两种完全不同的"知道"。

大语言模型对物理世界的"知道",更接近背书。它知道"杯子掉了会碎",是因为训练数据里有无数次"杯子""掉落""碎裂"的文本共现。它学会了这些词之间的统计关联。

但它脑子里没有一个三维的杯子,没有一张桌子,没有重力。它没有办法在内部"运行"一遍杯子掉落的过程,从滑动到倾斜、到掉落、到碰地、到碎裂、到碎片飞散。

你的大脑可以。你闭上眼就能"看到"这个过程,虽然你可能从来没学过牛顿力学。你的大脑里跑的不是一段关于重力的课文,而是某种空间性的、动态的、连续的内部模拟。

如果要给这个区别起个名字的话:大语言模型有的是命题性知识(能用语言陈述的事实),缺的是操作性表征(能在内部运行的动态模型)。

这就是"谈论世界"和"运行世界"的区别。

那么到底缺了什么?

现在可以把两个思路合在一起了。

我们说世界由时间、空间、物质、力构成。大语言模型对这四样东西都有命题性知识,但都缺少操作性表征。具体来说:

关于空间,语言是一维的符号序列。"杯子在桌上"这五个字,丢失了杯子的形状、体积、精确位置、与桌边的距离,几乎丢失了一切空间信息。模型需要的是在内部直接"拥有"三维空间,而不是把空间翻译成文字。

关于时间,语言模型的"时间"是一个 token 接一个 token,离散的、匀速的。但杯子掉落是零点几秒,铁锈蔓延是几个月。真实的时间是连续的,有快有慢。模型需要能在内部"运行"一段过程,而不是一步跳到结果。

关于物质,模型知道"玻璃是脆的",但这只是一个语言标签。真正的世界模型需要这个"脆"是一个可计算的物理参数(比如断裂韧性),能直接参与受力分析,而不是作为一个形容词等着被"理解"。

关于力,模型知道"推杯子它会动"。但如果你问"用多大的力、从什么角度推、在什么材质的桌面上、杯子会移动多远、会不会翻倒",它就开始编了。从"知道 A 导致 B"到"能算出 A 以什么程度导致 B",这个跨越还没有发生。

你发现了吗?这四道鸿沟有一个共同的深层模式:都是从离散的、符号化的表征,到连续的、可运行的表征的跨越。

语言天生是离散的,它把连续的世界切成一个一个的词。而物理世界是连续的,空间是连续的,时间是连续的,力是连续的,物质属性是连续的。用离散的符号去描述连续的世界,中间必然有系统性的信息丢失。不管你的模型多大、数据多多,这个结构性的鸿沟不会因为规模而消失。

那视频模型呢?视频不是连续的吗?

好问题。视频确实比语言丰富得多,有空间信息、有时间信息、有物体运动的连续过程。Sora 能生成一段杯子掉落碎裂的逼真视频,这不就是在"运行"世界吗?

还是差一步。

视频是世界的二维投影。它记录的是"看起来像什么",不是"实际是什么"。被遮挡的部分消失了,深度信息被压扁了。而且最关键的是,视频记录的是相关性,不是因果性。

举个例子:视频里一个铁球"自己"滚了起来。为什么?也许桌子下面藏了一块磁铁。但你从视频像素里看不到磁铁,你只看到球动了。视频给你的是结果,不是原因。

所以 Sora 那类模型学到的是:掉落的杯子后面,在像素层面,通常跟着碎片的画面。这是一条很好的视觉规律,足以生成逼真的视频。但"玻璃材质 + 碰撞力 > 断裂阈值 → 破碎"这条因果链,不在像素统计里。

这也是李飞飞文章里最精彩的一个说法。她说一个渲染器生成的城市航拍看起来完美无缺,但你试着开车穿过那个城市,建筑就崩塌了。因为渲染器只需要"看起来对",不需要"实际上对"。

所以终局是什么?

回到最开始的问题:世界模型到底是什么?

经过这一圈思考,我觉得可以给出一个比李飞飞的分类更底层的回答:

世界模型是一个系统对时间、空间、物质、力及其耦合关系的操作性内部表征,使得它能够在内部"运行"世界的动态过程,而非仅仅"谈论"世界的静态事实。

渲染、模拟、规划不是三种不同的世界模型,而是同一个世界模型的三种不同"读出方式"。向人眼读出就是渲染,向物理引擎读出就是模拟,向执行器读出就是规划。就像你脑中对客厅的那个模型,可以用来想象画面、预测杯子掉落、也可以规划走路路线,底层是同一个东西。

当前的研究是零散的:计算机视觉做 3D 重建,机器人学做运动规划,物理引擎做流体模拟。各做各的。但这些方向最终大概率会汇合,不是因为乐观,而是因为世界本身就是统一的。做渲染做到极致需要物理,做物理做到极致需要几何,做规划做到极致需要两者。起点不同,但终局应该一样。

大语言模型会是这条路的起点吗?也许。它已经拥有了人类知识中关于世界的大量命题性描述,这是一笔巨大的资产。但它还需要跨过那道从"谈论"到"运行"的鸿沟,从离散到连续,从符号到表征,从描述到模拟。

这大概是 AI 接下来最重要的一段路。不是让模型说得更好,而是让模型在内心深处,真正拥有一个可以运行的世界。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。

上一篇初中生都知道,大模型的数据还远没有用完下一篇老说AI没有人味,那到底什么才是人味啊?