作者:五源资本合伙人 孟醒
今天菲尔兹奖刷屏,王虹和邓煜的名字大家应该都看到了。有意思的是,这两天王虹的视频到处都在传,邓煜却安静得多,几乎没什么曝光。
我这几天反复在想的,偏偏是邓煜。倒不是因为这是一个华人数学家的故事——而是因为他和 Zaher Hani、马骁一起啃下的那个 125 年前的老问题,恰好击中了今天 AI 发展里一个越来越关键、却几乎所有人都绕着走的盲区。它甚至比"又一个菲尔兹奖"本身,更值得聊。
这个问题叫希尔伯特第六问题。
我第一次听到这个概念是来自于清华智院新晋助理教授刘子鸣,他说他的愿景是要解决希尔伯特第六问题。我当时不理解这是个什么问题这么重要,以及前五个问题为什么都跳过了。
后来了解了以后我发现教科书会把它概括成"用公理化的方式建立物理学"。这话没错,但太宏大,宏大到让人根本感觉不到它和今天的 AI 创业、AI 投资有什么关系。说得再具体一点,它想做的是:从描述单个微观粒子的基本规律出发,严格地、一步不省地推导出描述气体和流体的宏观方程。
我更愿意把它翻译成一句大白话:
当我们已经把世界的每一个基本单元都搞清楚了,凭什么就认为,把这些单元堆到足够多,就能自动得到更高一层的世界规律?
知道一个分子怎么运动,不等于知道一团气体怎么流动。
知道一个蛋白质怎么折叠,不等于知道一个细胞遇到药物会作何反应。
知道一个消费者会怎么填问卷,不等于知道一个市场最后会往哪走。
甚至,知道一个小模型里的参数怎么更新,也不等于我们真的理解了大模型里的泛化、grokking 和能力涌现(emergence)。
这些问题看上去分属物理、生物、社会科学和机器学习,八竿子打不着。但它们背后是同一个结构:
一个尺度上的正确,究竟怎样才能变成另一个尺度上的正确?
这才是希尔伯特第六问题对 AI 时代真正的意义所在。它也很可能是今天一大批所谓"世界模型"其实还没解决的那个问题。
先说邓煜团队到底做了什么。
想象一个盒子,里面装着无数个极小的硬球。每个球都只服从最朴素的牛顿力学:没碰上时匀速直线运动,撞上了就按动量守恒和能量守恒改变方向。仅此而已。
如果盒子里只有十个球,好办——给每个球编号,记录它的位置和速度,一步步往下算就行。
可真实气体里,一团空气大约有 10²³ 个分子。就算你有无限的算力,能把每一个分子的位置和速度都精确追踪下来,这种描述方式对"理解一阵风"也几乎没有帮助。因为当我们看着一阵风时,根本不关心第 784 亿亿个分子此刻是往左还是往右。我们真正想知道的是:这里的气体有多密?整体往哪个方向流?温度多高?压强多大?
于是,面对同一个物理世界,人类发展出了三套完全不同的描述语言:
牛顿硬球动力学(微观)→ 玻尔兹曼方程(介观)→ Euler 方程 / Navier–Stokes–Fourier 方程(宏观)
最底层是微观:牛顿硬球动力学,追踪每一个粒子的位置和速度。
中间是介观:玻尔兹曼方程。它不再给粒子编号,而是统计"在某个位置附近、以某种速度运动的粒子有多少"。
最上层是宏观:Euler 方程和 Navier–Stokes–Fourier 方程。到这一层,连完整的速度分布都不要了,只留下密度、平均速度、温度这几个宏观量。
从信息量看,这是一次极端激进的压缩:从 10²³ 个粒子的海量状态,压成空间里寥寥几个连续变化的场。
但这件事最难的地方,根本不是"做平均"。
做平均很容易。真正难的是证明这件事:
当你扔掉了绝大多数微观细节之后,凭什么保证那些被扔掉的东西,不会在未来某个时刻突然回来,把宏观结果搅乱?
换句话说——如果我只保留密度、速度、温度,那下一秒的密度、速度、温度,真的能只由此刻这几个宏观量算出来吗?还是走了一步之后,我又不得不回到底层,把所有分子的历史重新查一遍?
物理和数学里,这个问题有个专门的名字:闭合(closure)。一个宏观理论只有做到闭合,才算真正独立成立;否则它就不是理论,只是给微观仿真套了一层好看的接口。
这个词,请先记住。后面它会反复出现。
从牛顿粒子走到玻尔兹曼方程,最大的拦路虎,是粒子之间的相关性。
如果所有粒子从头到尾彼此独立,一切都好办。问题是它们会碰撞。
A 和 B 撞了一下,它俩的状态就不再独立了。随后 B 又撞 C,C 再撞 D。过一阵子,A 可能通过另一条路径又和 D 相遇。这时候 A 和 D 明明没有直接的初始关系,却已经被一条碰撞链悄悄连了起来:
A → B → C → D → …(相关性沿着碰撞链层层传播、分叉、再汇合)
这就像往水里扔石子,一圈圈涟漪扩散出去。一开始只是一对粒子之间的小关系,时间一长,就可能织成一张极其复杂的关系网:碰撞链会分叉,分支会重新汇合,碰过的粒子还会再碰。
玻尔兹曼方程能把问题大幅简化,靠的是一个关键近似——常被称为**"分子混沌"(molecular chaos)**:
两个即将碰撞的粒子,在碰撞之前,可以被近似看作彼此独立。
这不是说它们真的没历史。它们当然有过往的碰撞,也可能拐了好几个弯间接影响过彼此。玻尔兹曼真正需要的是:当粒子越来越多、尺寸越来越小、气体足够稀薄时,这些盘根错节的历史相关性,对当前这次碰撞的影响,最终可以忽略不计。
1975 年,Oscar Lanford 第一次把这件事严格证明了出来。
这里的"证明",不是跑个大仿真、看一群小球动起来像不像气体。他证明的是一个真正的极限定理:当粒子数无限大、粒子本身无限小的时候,牛顿硬球系统的统计分布会收敛到玻尔兹曼方程的解。
但 Lanford 的结果有个致命的限制:它只能撑一段极短的时间,大约只是一次平均碰撞时间的一小部分。
问题不在于真实气体过了这段时间就不服从玻尔兹曼方程了,也不在于粒子只能碰有限次。问题在于——他的证明方法自己失控了。
为了推演一个粒子的现在,你得往回追它跟谁碰过;为了搞清那个碰撞对象,你又得继续追它此前跟谁碰过。每往前多走一点时间,可能的碰撞历史数量就爆炸式增长。在很短的时间里,"发生这么多复杂碰撞"本身是个小概率事件,这个小概率还能压得住碰撞历史的组合爆炸;可时间一拉长,历史的组合数量指数级膨胀,传统的证明方法就再也没法把这些项加起来了。
这个困境,任何做过长程 rollout 的人都会觉得眼熟:一个模型在一步、十步之内预测得很准,绝不意味着你把它滚上一万步,误差、分叉和相关性还能被控制住。Lanford 证明了这条路的方向是对的,但他只走出了桥头很短的一截。
邓煜团队 2024 年的工作,突破的正是这道卡了将近半个世纪的时间障碍。
他们证明:只要作为目标的玻尔兹曼方程本身在这段时间里还存在足够规则的解,那么从牛顿硬球系统到玻尔兹曼方程的严格推导,就可以延伸到任意给定的有限时间,而不再被困在 Lanford 那一小截里。
这里的"任意长"需要谨慎理解。它不是说他们无条件证明到了宇宙终结。准确的意思是:你给定多长的一段有限时间,只要玻尔兹曼方程在这段时间里没有出现奇点、没有爆炸、没有失去正则性,微观粒子系统就会在这整段时间里一路收敛地跟着它走。
2025 年的第二篇论文,又往前接了一步。
从玻尔兹曼方程到 Euler、Navier–Stokes–Fourier 这些流体方程,数学界过去已经积累了大量工作。真正的堵点在于:从牛顿粒子到玻尔兹曼这第一座桥此前只能走极短一段,所以前后两段理论始终接不到一起。2025 年的论文把 2024 年的结果扩展到二维和三维周期空间,再和已有的流体极限理论拼接起来,第一次打通了完整的链条:
牛顿硬球系统 → 玻尔兹曼方程 → 可压 Euler 方程 / 不可压 Navier–Stokes–Fourier 方程
所以最朴素的理解是:2024 年,他们把"微观 → 介观"那座桥修长了;2025 年,他们把整条"微观 → 介观 → 宏观"的桥接通了。
当然要说清楚边界:他们解决的是希尔伯特第六问题里"从牛顿力学、经玻尔兹曼理论、推导出流体方程"这个经典版本,而不是把整个物理学都公理化了。它有明确的适用范围——稀薄气体、硬球模型、特定缩放、规则解存在,离复杂液体、长程相互作用、化学反应和真实边界条件还很远。
而我恰恰觉得,"边界讲得清清楚楚"这件事本身极其重要。这正是数学和很多 AI 叙事最大的区别:一个真正可信的模型,不但要告诉你它在哪些情况下成立,更要诚实地告诉你它在哪些情况下不成立。这一点,我们最后还会回来。
邓煜团队的工作之所以让我觉得和 AI 关系极大,是因为它把一个我们经常低估的事实,摆到了台面上:
世界在不同尺度上,往往需要完全不同的表示。
从粒子到流体,不是把粒子模型放大一万亿倍那么简单。进入宏观尺度以后,连描述世界的变量都换了:微观层面用位置和速度,介观层面用概率分布,宏观层面用密度、流速和温度。
跨到下一层尺度,不是数量的增加,而是语言的更换。
今天大家谈 world model,往往下意识地把它理解成一个越来越大的端到端模拟器:数据更多、参数更大、视频更长、rollout 更远、agent 更多——仿佛底层模拟得足够精细,高层规律就会自动浮现,而且我们还能自动知道怎么用它。
希尔伯特第六问题告诉我们:这一步,从来都不是免费的。
一个真正有用的世界模型,除了会预测,还得找到世界在某个尺度上的**"充分状态"**:这组状态要足够简单,简单到不必记录所有细节;又要足够完整,完整到能独立决定下一步会发生什么。密度、速度、温度,就是流体世界的一组充分状态——它们扔掉了几乎所有分子级细节,却依然能描述一阵风、一股水流,乃至空气中的一道冲击波。
所以世界模型真正高明的地方,很可能不是记得更多,恰恰相反——
是知道什么可以被安全地忘掉,并且能证明,忘掉之后不会错。
"安全"这两个字是关键。模型不光要压缩信息,还必须知道那些被压掉的变量,会不会通过反馈、相关性或长期演化,重新回来改变结果。这,说到底又回到了闭合。
用几个更锋利的问题来概括这一层的难点:
哪些底层差异其实已经无关紧要?哪些关系必须被保留?哪些微观扰动会被平均掉?哪些微观相关性反而会被放大成宏观结构?以及最要命的一个——我们留下的这组高层变量,是否足以独立地决定未来?
如果答案是"能",我们就得到了一个真正的宏观世界模型。如果每走一步还得回头查每个分子的完整状态,那我们手里的就不是理论,只是一个包了层皮的微观仿真器。
下面几节,是我想说的重点:这个"跨尺度"的难题,正一模一样地出现在今天最热的几个 AI 方向里。
药物研发是最典型的例子。
今天的 AI 已经能在很多单点问题上做得相当好:预测蛋白质结构、预测分子和靶点的结合、生成候选化合物、估计一个基因扰动对细胞表达的影响、预测某种细胞在药物作用下的反应。
这些都很重要。但药物最终有没有价值,不是在分子层面决定的,而是在患者身上决定的。中间隔着一条极长的尺度链:
分子 → 与靶点结合 → 影响通路 → 改变细胞 → 重塑组织 → 作用于器官 → 患者的疗效与副作用
一个分子能牢牢结合某个蛋白,不代表它一定能按预期改变细胞命运。改变了细胞命运,不代表它能修复组织。就算在目标器官里有效,也不代表它不会在另一个器官里产生毒性。
每往上走一层,系统都会冒出新的变量和新的反馈。敲掉一个基因,系统可能从另一条通路补偿回来;抑制一个蛋白,细胞可能干脆换一种代谢方式;杀死一部分肿瘤细胞,反而可能给剩下的细胞制造出选择压力。生物系统极少是线性的。
所以药物研发最难的,往往不是把某一层预测得更准,而是:怎样把一个尺度上的干预,可靠地传递到更高的尺度。
我第一次听到这个概念来自于我国第一个细胞动力学院士冯西桥老师,这也正是今天 virtual cell 方向真正的分量所在。AI Virtual Cell 的目标不是简单重建一张细胞图谱,而是学习细胞在不同条件和扰动下的动态反应——研究者也明确说了,需要跨测量方式、跨尺度建立统一表示,并用扰动预测来验证模型。
但请注意:即便我们真的拥有一个非常好的 virtual cell,离 virtual patient 依然很远。因为在组织模型眼里,一个细胞又重新变成了底层的"粒子"。细胞与细胞之间会通讯、竞争、迁移、改变彼此的状态。一个细胞模型做得再好,把一百万个这样的模型堆在一起,也不会自动得到一个可信的组织。
一个层级的宏观,常常只是下一个层级的微观。
生命不是一次性的 micro-to-macro,而是一整座层层向上的尺度阶梯。每跨一级,都是一个全新的希尔伯特第六问题。
另一个高度典型的方向,是 Agent Society。
包括 Aaru、Simile 在内的一批公司,以及一大串学术工作,正在尝试用大量 generative agents 去模拟消费者、选民、企业、政策和社会行为。Aaru 把自己定义为多智能体人口模拟系统;Simile 则提出要从个人、长期 journey 和互动,一步步扩展到整个市场乃至社会。学术界也已经能基于深度访谈,为一千多名真实参与者各建一个 agent,并测试它们对本人态度和行为的复现能力。
这类工作的第一步,是让单个 agent 足够像它所代表的人——能不能复现一个人的偏好、经历、说话方式和决策习惯。这一步做好了,已经很有价值。
但从"一个人"走到"一群人",中间藏着一个极大的逻辑跳跃:
"如果我们能准确模拟每一个个体,那把足够多个体放在一起,自然就能准确模拟社会。"
这句话听着天经地义,可它和"知道每个粒子的牛顿运动,就自然知道流体运动",几乎是一模一样的错误。
假设一个模型能非常准确地回答"你会不会买这款产品?",把十万个这样的回答加起来,你最多得到一份更快、更便宜的市场调研。它还不是一个市场模型。
因为市场从来不是十万个彼此独立的回答之和。它还取决于:消费者看见别人买了会不会改主意;竞争对手会不会降价;平台算法把流量分给了谁;KOL 和朋友的影响如何传播;稀缺感如何改变吸引力;以及——企业根据预测本身采取行动之后,原来的预测是否还成立。
A 影响 B,B 影响 C,C 又反过来影响 A。这些反馈和相关性,才是一个社会系统最要命的部分。这中间充满了和气体里一样的"碰撞"与"再碰撞"。
所以,Agent Society 真正难的问题,从来不是"单个 agent 像不像人",而是:
当无数 agent 开始彼此影响时,整个系统还像不像一个真实的社会?
评价这类公司,我觉得至少要拆成四层,而且这四层是递进的:
第一层,个体有效性:agent 像不像它所代表的那个人。
第二层,互动有效性:两个 agent 之间的互动,像不像两个真人在真实情境中的互动。
第三层,群体有效性:大量互动之后涌现出来的舆论、价格、规范和行为分布,接不接近真实市场和社会。
第四层,干预有效性:当我们改变价格、政策、产品或传播结构时,模型能不能预测真实世界会如何变化。
真正有巨大商业价值的,是第四层。但绝大多数 benchmark,还停在第一层、最多第二层。
这恰好暴露了 AI 投资里一个极常见的错位:
模型的 benchmark 发生在低一层,商业价值发生在高一层,而最大的风险,就藏在这两层之间。
我以前和刘子鸣聊过 grokking。他当时把自己研究的问题,形容成某种"AI 版本的希尔伯特第六问题",我觉得这个类比很精准。
Grokking 是个极反直觉的现象:一个模型可能很早就把训练集背得滚瓜烂熟,但在测试集上表现依然很差;继续训练很长很长时间之后,它却会突然从"记忆"转向"理解",泛化能力一下子拉起来。
刘子鸣他们的研究思路,是先在非常小、非常简单的模型里把内部机制看清楚——表征学习的动力学、相图(phase diagram)——再研究这套机制如何随着数据规模、参数规模、正则化和训练条件的变化,向上延展到更大的模型。
这和粒子到流体当然不是一回事,但结构上高度相似。因为神经网络里也有不同的尺度:
微观层面是每个参数怎么变、每个梯度怎么更新、每个神经元和 feature 怎么形成。
更高一层是模型有没有形成结构化表征、有没有从 memorization 转向 generalization、会不会突然 grokking、会不会在规模跨过某个阈值后冒出 emergent ability。
我们今天习惯用 scaling law 来描述宏观结果:参数更多、数据更多、算力更多,loss 就按某种规律往下掉。但 scaling law 主要告诉我们"结果如何变化",并不告诉我们"内部到底发生了什么"。
它有点像:我们已经观察到温度和压强怎么变,却还没能把它们从分子碰撞里真正推导出来。
所以,AI 自己的希尔伯特第六问题,也许可以这样表述:
我们能不能从参数、梯度和训练动力学出发,解释表征、泛化、推理和 emergence 这些宏观能力为什么会出现?以及,我们能不能判断——小模型里观察到的机制,什么时候能外推到大模型,什么时候只是有限规模下的幻觉?
这件事非常重要,因为 AI 研究里有一套极常见的方法论:先在 toy model 里发现一个现象,给出一个漂亮的解释,然后默认它在百亿、千亿参数的模型里照样成立。可小模型到大模型,本身就是一次尺度转换——它需要被证明,而不能只靠类比。
反过来同样成立:在大模型里观察到一条漂亮的经验曲线,也不等于我们已经理解了背后的机制。就像看见流体在流动,不等于你已经从牛顿力学推出了 Navier–Stokes。
同一个问题,还出现在一大堆别的方向里。
天气与湍流。我们不可能解析每一个微小涡旋,所以必须把小于网格尺度的过程,压缩成一个 closure model(闭合模型)。机器学习正被用来学习这些 subgrid 过程如何反馈到大尺度流场——但一个在训练数据上拟合得很漂亮的 closure,放回长期物理仿真里,可能迅速变得不稳定,甚至破坏能量守恒、对称性和极端条件下的泛化。
自动驾驶与机器人。预测下一帧视频,不等于理解一个长期可交互的物理世界。从像素到物体、从物体到场景、从场景到其他参与者的意图、再从单车行为到城市交通,同样是一级级连续的尺度跃迁。一个单车模型每一步都很准,把它放进由大量人类司机、行人和其他自动驾驶车构成的系统里,宏观结果可能完全变样。
企业里的 AI。我们经常听到一种 ROI 推导:每个程序员效率提高 30%,所以公司研发效率提高 30%。但组织产出从来不是个人产出的简单相加。代码写得更多,可能加重 review 负担;需求产得更快,可能加剧优先级混乱;每个人沟通更容易,可能带来更多会议;局部效率的提升,完全可能被组织协调成本吃干抹净。这和"更聪明的 agent 一定组成更聪明的 agent society",是同一种错误。从个体能力到系统产出,中间还隔着组织结构、工作流、激励、信息流和责任机制。
看到这里,那句核心判断值得再钉一遍:
Scaling a simulator,并不等于 simulating a scale。把模拟器做大,不等于你已经进入了一个新的尺度。 一百万个粒子,不是一个流体模型。一百万个细胞模型,不是一个人体模型。一百万个消费者 agent,也不是一个社会模型。
规模的扩大,可能带来新规律,但它不会自动告诉你那些规律是什么,更不会自动证明它们可靠。
希尔伯特第六问题之所以重要,不只是因为它存在了 125 年,也不只是因为终于有人向前跨出了一大步。而是因为它提出了一种极深刻的世界观:
世界不是一个只有单一分辨率的平面,而是由一层层不同的尺度构成的。
在不同尺度上,重要的对象不同、描述的变量不同、有效的规律不同,连有效边界也不同。微观定律不会因为你把系统放大,就自动变成宏观定律——中间需要一次真正的理论跃迁,需要新的表示、新的假设,还需要知道哪些细节可以扔、哪些相关性必须留。
今天,我们正在用 AI 模拟越来越多的世界:分子、细胞、材料、天气、机器人、人类行为、市场与社会,甚至 AI 模型自己。而每一个方向走到最后,大概都会撞上同一个问题:
我们在一个尺度上的成功,究竟能不能被带到下一个尺度?
如果证明不了这一点,我们拥有的可能只是一个非常强的局部预测器,而不是一个真正的世界模型。
我们也许能非常准确地预测一个蛋白质,却依然不知道一个患者为什么康复;能非常准确地模拟一个消费者,却依然不知道潮流为什么形成;能非常清楚一个小模型如何 grok,却依然不知道智能为什么会在更大的规模上涌现。
更大的模型,不等于更大的世界。
真正的世界模型,不是把所有细节都塞进一个无限大的神经网络,直到复制整个宇宙。它需要在每一个尺度上都知道:什么必须被记住,什么可以被忘掉,什么会在平均中消失,什么会在相互作用中被放大,什么能够向上涌现——以及,为什么。
能够完成这些尺度之间的翻译,才是世界模型真正困难、也真正有价值的那一步开始的地方。
1.02萬 熱度
135.88萬 熱度
7.08萬 熱度
181.53萬 熱度
39.41萬 熱度
邓煜獲得菲爾茲獎:他解決的問題讓 AI 卡住了
作者:五源资本合伙人 孟醒
今天菲尔兹奖刷屏,王虹和邓煜的名字大家应该都看到了。有意思的是,这两天王虹的视频到处都在传,邓煜却安静得多,几乎没什么曝光。
我这几天反复在想的,偏偏是邓煜。倒不是因为这是一个华人数学家的故事——而是因为他和 Zaher Hani、马骁一起啃下的那个 125 年前的老问题,恰好击中了今天 AI 发展里一个越来越关键、却几乎所有人都绕着走的盲区。它甚至比"又一个菲尔兹奖"本身,更值得聊。
这个问题叫希尔伯特第六问题。
我第一次听到这个概念是来自于清华智院新晋助理教授刘子鸣,他说他的愿景是要解决希尔伯特第六问题。我当时不理解这是个什么问题这么重要,以及前五个问题为什么都跳过了。
后来了解了以后我发现教科书会把它概括成"用公理化的方式建立物理学"。这话没错,但太宏大,宏大到让人根本感觉不到它和今天的 AI 创业、AI 投资有什么关系。说得再具体一点,它想做的是:从描述单个微观粒子的基本规律出发,严格地、一步不省地推导出描述气体和流体的宏观方程。
我更愿意把它翻译成一句大白话:
知道一个分子怎么运动,不等于知道一团气体怎么流动。
知道一个蛋白质怎么折叠,不等于知道一个细胞遇到药物会作何反应。
知道一个消费者会怎么填问卷,不等于知道一个市场最后会往哪走。
甚至,知道一个小模型里的参数怎么更新,也不等于我们真的理解了大模型里的泛化、grokking 和能力涌现(emergence)。
这些问题看上去分属物理、生物、社会科学和机器学习,八竿子打不着。但它们背后是同一个结构:
这才是希尔伯特第六问题对 AI 时代真正的意义所在。它也很可能是今天一大批所谓"世界模型"其实还没解决的那个问题。
一群小球,凭什么变成一股水流
先说邓煜团队到底做了什么。
想象一个盒子,里面装着无数个极小的硬球。每个球都只服从最朴素的牛顿力学:没碰上时匀速直线运动,撞上了就按动量守恒和能量守恒改变方向。仅此而已。
如果盒子里只有十个球,好办——给每个球编号,记录它的位置和速度,一步步往下算就行。
可真实气体里,一团空气大约有 10²³ 个分子。就算你有无限的算力,能把每一个分子的位置和速度都精确追踪下来,这种描述方式对"理解一阵风"也几乎没有帮助。因为当我们看着一阵风时,根本不关心第 784 亿亿个分子此刻是往左还是往右。我们真正想知道的是:这里的气体有多密?整体往哪个方向流?温度多高?压强多大?
于是,面对同一个物理世界,人类发展出了三套完全不同的描述语言:
最底层是微观:牛顿硬球动力学,追踪每一个粒子的位置和速度。
中间是介观:玻尔兹曼方程。它不再给粒子编号,而是统计"在某个位置附近、以某种速度运动的粒子有多少"。
最上层是宏观:Euler 方程和 Navier–Stokes–Fourier 方程。到这一层,连完整的速度分布都不要了,只留下密度、平均速度、温度这几个宏观量。
从信息量看,这是一次极端激进的压缩:从 10²³ 个粒子的海量状态,压成空间里寥寥几个连续变化的场。
但这件事最难的地方,根本不是"做平均"。
做平均很容易。真正难的是证明这件事:
换句话说——如果我只保留密度、速度、温度,那下一秒的密度、速度、温度,真的能只由此刻这几个宏观量算出来吗?还是走了一步之后,我又不得不回到底层,把所有分子的历史重新查一遍?
物理和数学里,这个问题有个专门的名字:闭合(closure)。一个宏观理论只有做到闭合,才算真正独立成立;否则它就不是理论,只是给微观仿真套了一层好看的接口。
这个词,请先记住。后面它会反复出现。
难的不是碰撞,而是碰撞留下的"记忆"
从牛顿粒子走到玻尔兹曼方程,最大的拦路虎,是粒子之间的相关性。
如果所有粒子从头到尾彼此独立,一切都好办。问题是它们会碰撞。
A 和 B 撞了一下,它俩的状态就不再独立了。随后 B 又撞 C,C 再撞 D。过一阵子,A 可能通过另一条路径又和 D 相遇。这时候 A 和 D 明明没有直接的初始关系,却已经被一条碰撞链悄悄连了起来:
这就像往水里扔石子,一圈圈涟漪扩散出去。一开始只是一对粒子之间的小关系,时间一长,就可能织成一张极其复杂的关系网:碰撞链会分叉,分支会重新汇合,碰过的粒子还会再碰。
玻尔兹曼方程能把问题大幅简化,靠的是一个关键近似——常被称为**"分子混沌"(molecular chaos)**:
这不是说它们真的没历史。它们当然有过往的碰撞,也可能拐了好几个弯间接影响过彼此。玻尔兹曼真正需要的是:当粒子越来越多、尺寸越来越小、气体足够稀薄时,这些盘根错节的历史相关性,对当前这次碰撞的影响,最终可以忽略不计。
1975 年,Oscar Lanford 第一次把这件事严格证明了出来。
这里的"证明",不是跑个大仿真、看一群小球动起来像不像气体。他证明的是一个真正的极限定理:当粒子数无限大、粒子本身无限小的时候,牛顿硬球系统的统计分布会收敛到玻尔兹曼方程的解。
但 Lanford 的结果有个致命的限制:它只能撑一段极短的时间,大约只是一次平均碰撞时间的一小部分。
问题不在于真实气体过了这段时间就不服从玻尔兹曼方程了,也不在于粒子只能碰有限次。问题在于——他的证明方法自己失控了。
为了推演一个粒子的现在,你得往回追它跟谁碰过;为了搞清那个碰撞对象,你又得继续追它此前跟谁碰过。每往前多走一点时间,可能的碰撞历史数量就爆炸式增长。在很短的时间里,"发生这么多复杂碰撞"本身是个小概率事件,这个小概率还能压得住碰撞历史的组合爆炸;可时间一拉长,历史的组合数量指数级膨胀,传统的证明方法就再也没法把这些项加起来了。
这个困境,任何做过长程 rollout 的人都会觉得眼熟:一个模型在一步、十步之内预测得很准,绝不意味着你把它滚上一万步,误差、分叉和相关性还能被控制住。Lanford 证明了这条路的方向是对的,但他只走出了桥头很短的一截。
邓煜团队 2024 年的工作,突破的正是这道卡了将近半个世纪的时间障碍。
他们证明:只要作为目标的玻尔兹曼方程本身在这段时间里还存在足够规则的解,那么从牛顿硬球系统到玻尔兹曼方程的严格推导,就可以延伸到任意给定的有限时间,而不再被困在 Lanford 那一小截里。
这里的"任意长"需要谨慎理解。它不是说他们无条件证明到了宇宙终结。准确的意思是:你给定多长的一段有限时间,只要玻尔兹曼方程在这段时间里没有出现奇点、没有爆炸、没有失去正则性,微观粒子系统就会在这整段时间里一路收敛地跟着它走。
2025 年的第二篇论文,又往前接了一步。
从玻尔兹曼方程到 Euler、Navier–Stokes–Fourier 这些流体方程,数学界过去已经积累了大量工作。真正的堵点在于:从牛顿粒子到玻尔兹曼这第一座桥此前只能走极短一段,所以前后两段理论始终接不到一起。2025 年的论文把 2024 年的结果扩展到二维和三维周期空间,再和已有的流体极限理论拼接起来,第一次打通了完整的链条:
所以最朴素的理解是:2024 年,他们把"微观 → 介观"那座桥修长了;2025 年,他们把整条"微观 → 介观 → 宏观"的桥接通了。
当然要说清楚边界:他们解决的是希尔伯特第六问题里"从牛顿力学、经玻尔兹曼理论、推导出流体方程"这个经典版本,而不是把整个物理学都公理化了。它有明确的适用范围——稀薄气体、硬球模型、特定缩放、规则解存在,离复杂液体、长程相互作用、化学反应和真实边界条件还很远。
而我恰恰觉得,"边界讲得清清楚楚"这件事本身极其重要。这正是数学和很多 AI 叙事最大的区别:一个真正可信的模型,不但要告诉你它在哪些情况下成立,更要诚实地告诉你它在哪些情况下不成立。这一点,我们最后还会回来。
世界模型的本质,不是记住更多,而是知道如何忘记
邓煜团队的工作之所以让我觉得和 AI 关系极大,是因为它把一个我们经常低估的事实,摆到了台面上:
从粒子到流体,不是把粒子模型放大一万亿倍那么简单。进入宏观尺度以后,连描述世界的变量都换了:微观层面用位置和速度,介观层面用概率分布,宏观层面用密度、流速和温度。
跨到下一层尺度,不是数量的增加,而是语言的更换。
今天大家谈 world model,往往下意识地把它理解成一个越来越大的端到端模拟器:数据更多、参数更大、视频更长、rollout 更远、agent 更多——仿佛底层模拟得足够精细,高层规律就会自动浮现,而且我们还能自动知道怎么用它。
希尔伯特第六问题告诉我们:这一步,从来都不是免费的。
一个真正有用的世界模型,除了会预测,还得找到世界在某个尺度上的**"充分状态"**:这组状态要足够简单,简单到不必记录所有细节;又要足够完整,完整到能独立决定下一步会发生什么。密度、速度、温度,就是流体世界的一组充分状态——它们扔掉了几乎所有分子级细节,却依然能描述一阵风、一股水流,乃至空气中的一道冲击波。
所以世界模型真正高明的地方,很可能不是记得更多,恰恰相反——
"安全"这两个字是关键。模型不光要压缩信息,还必须知道那些被压掉的变量,会不会通过反馈、相关性或长期演化,重新回来改变结果。这,说到底又回到了闭合。
用几个更锋利的问题来概括这一层的难点:
哪些底层差异其实已经无关紧要?哪些关系必须被保留?哪些微观扰动会被平均掉?哪些微观相关性反而会被放大成宏观结构?以及最要命的一个——我们留下的这组高层变量,是否足以独立地决定未来?
如果答案是"能",我们就得到了一个真正的宏观世界模型。如果每走一步还得回头查每个分子的完整状态,那我们手里的就不是理论,只是一个包了层皮的微观仿真器。
下面几节,是我想说的重点:这个"跨尺度"的难题,正一模一样地出现在今天最热的几个 AI 方向里。
AI for Drug Discovery:从结合一个靶点,到治好一个人,中间还隔着多少层
药物研发是最典型的例子。
今天的 AI 已经能在很多单点问题上做得相当好:预测蛋白质结构、预测分子和靶点的结合、生成候选化合物、估计一个基因扰动对细胞表达的影响、预测某种细胞在药物作用下的反应。
这些都很重要。但药物最终有没有价值,不是在分子层面决定的,而是在患者身上决定的。中间隔着一条极长的尺度链:
一个分子能牢牢结合某个蛋白,不代表它一定能按预期改变细胞命运。改变了细胞命运,不代表它能修复组织。就算在目标器官里有效,也不代表它不会在另一个器官里产生毒性。
每往上走一层,系统都会冒出新的变量和新的反馈。敲掉一个基因,系统可能从另一条通路补偿回来;抑制一个蛋白,细胞可能干脆换一种代谢方式;杀死一部分肿瘤细胞,反而可能给剩下的细胞制造出选择压力。生物系统极少是线性的。
所以药物研发最难的,往往不是把某一层预测得更准,而是:怎样把一个尺度上的干预,可靠地传递到更高的尺度。
我第一次听到这个概念来自于我国第一个细胞动力学院士冯西桥老师,这也正是今天 virtual cell 方向真正的分量所在。AI Virtual Cell 的目标不是简单重建一张细胞图谱,而是学习细胞在不同条件和扰动下的动态反应——研究者也明确说了,需要跨测量方式、跨尺度建立统一表示,并用扰动预测来验证模型。
但请注意:即便我们真的拥有一个非常好的 virtual cell,离 virtual patient 依然很远。因为在组织模型眼里,一个细胞又重新变成了底层的"粒子"。细胞与细胞之间会通讯、竞争、迁移、改变彼此的状态。一个细胞模型做得再好,把一百万个这样的模型堆在一起,也不会自动得到一个可信的组织。
生命不是一次性的 micro-to-macro,而是一整座层层向上的尺度阶梯。每跨一级,都是一个全新的希尔伯特第六问题。
Agent Society:模拟一个人,和模拟一个社会,是两种能力
另一个高度典型的方向,是 Agent Society。
包括 Aaru、Simile 在内的一批公司,以及一大串学术工作,正在尝试用大量 generative agents 去模拟消费者、选民、企业、政策和社会行为。Aaru 把自己定义为多智能体人口模拟系统;Simile 则提出要从个人、长期 journey 和互动,一步步扩展到整个市场乃至社会。学术界也已经能基于深度访谈,为一千多名真实参与者各建一个 agent,并测试它们对本人态度和行为的复现能力。
这类工作的第一步,是让单个 agent 足够像它所代表的人——能不能复现一个人的偏好、经历、说话方式和决策习惯。这一步做好了,已经很有价值。
但从"一个人"走到"一群人",中间藏着一个极大的逻辑跳跃:
这句话听着天经地义,可它和"知道每个粒子的牛顿运动,就自然知道流体运动",几乎是一模一样的错误。
假设一个模型能非常准确地回答"你会不会买这款产品?",把十万个这样的回答加起来,你最多得到一份更快、更便宜的市场调研。它还不是一个市场模型。
因为市场从来不是十万个彼此独立的回答之和。它还取决于:消费者看见别人买了会不会改主意;竞争对手会不会降价;平台算法把流量分给了谁;KOL 和朋友的影响如何传播;稀缺感如何改变吸引力;以及——企业根据预测本身采取行动之后,原来的预测是否还成立。
A 影响 B,B 影响 C,C 又反过来影响 A。这些反馈和相关性,才是一个社会系统最要命的部分。这中间充满了和气体里一样的"碰撞"与"再碰撞"。
所以,Agent Society 真正难的问题,从来不是"单个 agent 像不像人",而是:
评价这类公司,我觉得至少要拆成四层,而且这四层是递进的:
第一层,个体有效性:agent 像不像它所代表的那个人。
第二层,互动有效性:两个 agent 之间的互动,像不像两个真人在真实情境中的互动。
第三层,群体有效性:大量互动之后涌现出来的舆论、价格、规范和行为分布,接不接近真实市场和社会。
第四层,干预有效性:当我们改变价格、政策、产品或传播结构时,模型能不能预测真实世界会如何变化。
真正有巨大商业价值的,是第四层。但绝大多数 benchmark,还停在第一层、最多第二层。
这恰好暴露了 AI 投资里一个极常见的错位:
Grokking 与 Emergence:AI 自己也有一个希尔伯特第六问题
我以前和刘子鸣聊过 grokking。他当时把自己研究的问题,形容成某种"AI 版本的希尔伯特第六问题",我觉得这个类比很精准。
Grokking 是个极反直觉的现象:一个模型可能很早就把训练集背得滚瓜烂熟,但在测试集上表现依然很差;继续训练很长很长时间之后,它却会突然从"记忆"转向"理解",泛化能力一下子拉起来。
刘子鸣他们的研究思路,是先在非常小、非常简单的模型里把内部机制看清楚——表征学习的动力学、相图(phase diagram)——再研究这套机制如何随着数据规模、参数规模、正则化和训练条件的变化,向上延展到更大的模型。
这和粒子到流体当然不是一回事,但结构上高度相似。因为神经网络里也有不同的尺度:
微观层面是每个参数怎么变、每个梯度怎么更新、每个神经元和 feature 怎么形成。
更高一层是模型有没有形成结构化表征、有没有从 memorization 转向 generalization、会不会突然 grokking、会不会在规模跨过某个阈值后冒出 emergent ability。
我们今天习惯用 scaling law 来描述宏观结果:参数更多、数据更多、算力更多,loss 就按某种规律往下掉。但 scaling law 主要告诉我们"结果如何变化",并不告诉我们"内部到底发生了什么"。
所以,AI 自己的希尔伯特第六问题,也许可以这样表述:
这件事非常重要,因为 AI 研究里有一套极常见的方法论:先在 toy model 里发现一个现象,给出一个漂亮的解释,然后默认它在百亿、千亿参数的模型里照样成立。可小模型到大模型,本身就是一次尺度转换——它需要被证明,而不能只靠类比。
反过来同样成立:在大模型里观察到一条漂亮的经验曲线,也不等于我们已经理解了背后的机制。就像看见流体在流动,不等于你已经从牛顿力学推出了 Navier–Stokes。
天气、机器人和企业组织,也都撞在同一堵墙上
同一个问题,还出现在一大堆别的方向里。
天气与湍流。我们不可能解析每一个微小涡旋,所以必须把小于网格尺度的过程,压缩成一个 closure model(闭合模型)。机器学习正被用来学习这些 subgrid 过程如何反馈到大尺度流场——但一个在训练数据上拟合得很漂亮的 closure,放回长期物理仿真里,可能迅速变得不稳定,甚至破坏能量守恒、对称性和极端条件下的泛化。
自动驾驶与机器人。预测下一帧视频,不等于理解一个长期可交互的物理世界。从像素到物体、从物体到场景、从场景到其他参与者的意图、再从单车行为到城市交通,同样是一级级连续的尺度跃迁。一个单车模型每一步都很准,把它放进由大量人类司机、行人和其他自动驾驶车构成的系统里,宏观结果可能完全变样。
企业里的 AI。我们经常听到一种 ROI 推导:每个程序员效率提高 30%,所以公司研发效率提高 30%。但组织产出从来不是个人产出的简单相加。代码写得更多,可能加重 review 负担;需求产得更快,可能加剧优先级混乱;每个人沟通更容易,可能带来更多会议;局部效率的提升,完全可能被组织协调成本吃干抹净。这和"更聪明的 agent 一定组成更聪明的 agent society",是同一种错误。从个体能力到系统产出,中间还隔着组织结构、工作流、激励、信息流和责任机制。
看到这里,那句核心判断值得再钉一遍:
规模的扩大,可能带来新规律,但它不会自动告诉你那些规律是什么,更不会自动证明它们可靠。
每一个世界模型,都有属于自己的希尔伯特第六问题
希尔伯特第六问题之所以重要,不只是因为它存在了 125 年,也不只是因为终于有人向前跨出了一大步。而是因为它提出了一种极深刻的世界观:
在不同尺度上,重要的对象不同、描述的变量不同、有效的规律不同,连有效边界也不同。微观定律不会因为你把系统放大,就自动变成宏观定律——中间需要一次真正的理论跃迁,需要新的表示、新的假设,还需要知道哪些细节可以扔、哪些相关性必须留。
今天,我们正在用 AI 模拟越来越多的世界:分子、细胞、材料、天气、机器人、人类行为、市场与社会,甚至 AI 模型自己。而每一个方向走到最后,大概都会撞上同一个问题:
如果证明不了这一点,我们拥有的可能只是一个非常强的局部预测器,而不是一个真正的世界模型。
我们也许能非常准确地预测一个蛋白质,却依然不知道一个患者为什么康复;能非常准确地模拟一个消费者,却依然不知道潮流为什么形成;能非常清楚一个小模型如何 grok,却依然不知道智能为什么会在更大的规模上涌现。
更大的模型,不等于更大的世界。
真正的世界模型,不是把所有细节都塞进一个无限大的神经网络,直到复制整个宇宙。它需要在每一个尺度上都知道:什么必须被记住,什么可以被忘掉,什么会在平均中消失,什么会在相互作用中被放大,什么能够向上涌现——以及,为什么。
能够完成这些尺度之间的翻译,才是世界模型真正困难、也真正有价值的那一步开始的地方。