世界模型的"皇帝新衣":视频生成 ≠ 物理理解¶
最后更新: 2026-04-17 | 本文是对整个调研的批判性反思
核心论点:大部分"世界模型"公司其实是视频生成公司换了名字。真正的物理理解几乎不存在。
一、三种定义,三个标准¶
Ha & Schmidhuber 2018: 工具性定义¶
-
世界模型 = 智能体内部的压缩环境表征
-
用途: 在"梦境"(潜在想象)中训练策略
-
不要求物理正确性, 只要策略能优化即可
LeCun 2022: 因果认知定义¶
-
世界模型 = 支持因果推理和反事实规划的心智模型
-
明确反对像素级生成
-
"用像素预测来训练世界模型是一个糟糕的想法"
Hassabis / DeepMind: 物理精度定义¶
-
世界模型必须理解物理和空间
-
正在建立基准: 在模拟中验证单摆/滚球是否100%遵守牛顿定律
-
承认 Veo 等视频模型"看起来逼真, 但不是物理级精确"
结论¶
三大定义都不支持"能生成逼真视频 = 世界模型"。Sora论文标题"Video Generation Models as World Simulators"是概念混淆的始作俑者。
二、视频生成 ≠ 物理理解: 六项铁证¶
证据 1: WorldBench 的量化打脸¶
重力加速度估计 (真值 9.81 m/s²):
-
Cosmos-1 AR: 4.215 ± 3.713 (误差 >50%)
-
WAN 2.2: 0.378 ± 0.784 (真值的 1/26)
-
CogVideoX: -0.039 (负值! 物体向上加速!)
流体粘度估计: 所有模型全面失败
-
甘油(真值1.2 Pa·s): 模型估计 0.2-7.8
-
蜂蜜(真值14.1 Pa·s): 模型估计 0.17->50, 跨3个数量级
WorldBench 结论: "视觉上真实的运动轨迹, 不遵从真实的运动参数"
证据 2: "开普勒 vs 牛顿" (arXiv:2602.06923)¶
-
开普勒陷阱: Transformer 总是倾向学习曲线拟合而非因果机制
-
两种模式在分布内预测精度几乎无差异, 分布外天壤之别
-
打破陷阱需要: 空间平滑性 + 稳定性 + 时间局部性(最关键)
-
结论: "简单的架构选择决定了AI是曲线拟合者还是物理学家"
证据 3: PhysBench (ICLR 2025 Oral)¶
-
75 个 VLM, 10002 条物理推理测试
-
GPT-4o 比最好的开源模型高 20.7%, 但绝对分数仍远低于人类
-
VLM 在"常识"上好, 在"物理世界理解"上普遍失败
证据 4: OOD 误差高 35× (ICML 2025)¶
-
分布内速度误差: 0.012
-
分布外速度误差: 0.427 (高 35 倍!)
-
扩大训练规模对 OOD 误差几乎没有改善
-
模型的归纳优先级: 颜色 > 大小 > 速度 > 形状 (这不是物理的优先级!)
证据 5: 反事实推理 ≈ 随机猜测¶
-
GPT-4V 反事实问题: 39.8% (vs 事实性 83.1%)
-
视频模型只能被动生成固定轨迹, 不支持"如果我做了X会怎样"
证据 6: arXiv:2507.05169《世界模型批判》¶
-
"当前系统普遍强调视频生成, 缺乏令人信服的理由"
-
World Labs 的 3D 产品"模拟没有动态agent、物理或交互的静态环境"
-
严厉结论: 所有被调查系统都"不足以实现目标导向推理和规划"
三、真正的"物理"在哪里?¶
这些工作技术上更严谨, 但几乎没进入"世界模型"商业叙事。
Physics-Informed Neural Networks (PINNs)¶
-
将 PDE 直接嵌入损失函数, 网络必须满足物理约束
-
不从视频像素学习, 从守恒定律/PDE残差中学习
-
这是根本性的方法论差异
PhyDNet (CVPR 2020)¶
-
双分支: PhyCell(PDE约束) + 内容分支(非物理信息)
-
在4个数据集超越SOTA
-
显式物理约束 + 学习方法的结合
可微分物理引擎¶
-
DiffTaichi (MIT ICLR 2020): 可微编程, 10个物理模拟器
-
Brax (Google NeurIPS 2021): JAX, GPU大规模刚体
-
MuJoCo/MJX (DeepMind): 物理精确, JAX可微
-
NVIDIA Newton (2025): NVIDIA+Google+Disney联合, 专为机器人
这些工具的特点: 物理是硬编码的基本事实, 不是从数据猜测的。
GNN-Based 物理模拟¶
-
GNS (ICML 2020): 粒子图 + 消息传递, 比传统MPM快5000×
-
加入动量守恒的物理信息GNN比纯数据驱动GNS显著更稳定 (Nature Communications 2025)
为什么这些没进入"世界模型"叙事?¶
-
商业化: 无法生成可视化内容, 不适合融资/媒体
-
评估分裂: FID/FVD (感知质量) vs MSE/守恒违反率 (物理精度), 两套指标从不对话
-
规模叙事: 显式物理约束的模型在规模上没有同等优势
-
领域割裂: PINNs 发在 J. Computational Physics; 世界模型发在 NeurIPS; 两个社区几乎不重叠
四、真正的世界模型需要什么?(六项能力)¶
1. 因果推理¶
-
当前: 学"什么一起出现", 非"什么导致什么"
-
分布内无法区分两者; 分布外天壤之别
2. 反事实推理¶
-
当前: GPT-4V 反事实 39.8% ≈ 随机猜测
-
需要: "如果我做了X, Y会怎样?"
3. 物体恒常性¶
-
当前: 遮挡后物体消失/变形
-
需要: 遮挡后仍存在且属性一致
4. 组合泛化¶
-
当前: "苹果落地" + "球滚动" ≠ "苹果也会滚动"
-
增加模板多样性(6→60)可降低异常率, 但这是暴力解法
5. 长程一致性¶
-
当前: Genie 3 约1分钟; 物理定律在同一视频内可变
-
需要: 重力不会中途改变
6. 交互性¶
-
当前: 固定轨迹视频, 不支持动作响应
-
需要: 对物理动作做出正确响应
五、谁在认真做?谁在蹭概念?¶
认真做的¶
-
Dreamer V1-V4: 在模拟器中验证因果预测, 合法性来自可测量的行为成功率(非视频画质)
-
LeCun / JEPA / AMI Labs: 非生成式, 表征空间, 最直接批评概念混淆
-
Causal-JEPA (arXiv:2602.11389): 物体级潜在干预, 诱导反事实效果
-
PINNs / PhyDNet / 可微引擎: 真正的物理, 但不在WM叙事中
-
物理信息 GNN (Nature Communications 2025): 动量守恒约束
蹭概念的¶
-
Runway "GWM-1": Video Arena #1, 但衡量的是人类感知偏好, 与物理正确性无关
-
Sora "World Simulator": 标题是混淆的起源, OpenAI从未声称满足严格定义
-
部分国内视频生成公司重新标签为"世界模型"
中间地带¶
-
NVIDIA Cosmos-Predict: 视频生成, WorldBench失败 → 偏蹭概念
-
NVIDIA Cosmos-Reason2: 明确以物理推理为目标, Physical AI Bench #1 → 偏认真
-
DeepMind Genie 3: 交互性真实, 物理从数据涌现, 但非精确 → 偏认真
-
Wayve GAIA-3: 域内物理一致性进步, 但离参数精确远 → 中间
六、为什么"物理"这么难?¶
信息论: 像素 → 物理是欠定反问题¶
-
物理定律高度压缩 (F=ma 比任何训练视频都短)
-
从像素运动推导力的作用 = 逆向工程
-
同一像素运动可由无数不同力系统产生 (ill-posed)
-
需要归纳偏置来解决欠定性
Pearl 因果层级¶
-
第1层 关联(统计): "A发生时B倾向发生?" ← 视频生成模型在这里
-
第2层 干预(因果): "如果我干预A, B会怎样?" ← 几乎没有模型到这里
-
第3层 反事实(想象): "如果A不发生, B会怎样?" ← 0
像素重建损失无法引导模型到达因果层级。这不是规模问题, 是架构和训练目标的根本设计缺陷。
开普勒陷阱: 为什么不可避免?¶
-
曲线拟合比因果发现更容易被梯度下降找到
-
在训练损失上两者表现同等, 但搜索空间前者更小
-
最优化压力永远引导模型走向最短曲线, 而非最简物理定律
三类解法方向¶
-
结构化归纳偏置: 时间局部性 / PDE约束 / 动量守恒
-
混合架构: 可微物理引擎 + 神经网络 / 符号回归(AI Feynman, PySR)
-
因果表征学习: Causal-JEPA / 物理作为因果发现的归纳偏置
七、全景对照表¶
真正的世界模型需要 vs 当前"世界模型"公司提供的:
-
因果推理 → 统计相关学习
-
物理参数精确 (g=9.81) → 视觉逼真 (g≈4.2 或 g=-0.04)
-
反事实推理 → 分布内插值 (OOD误差高35×)
-
组合泛化 → 案例记忆 (颜色>速度>形状优先级)
-
交互性 (物理响应) → 固定轨迹视频生成
-
长程一致性 → 几十秒到1分钟
八、这场混淆的代价¶
投资者、政策制定者、工程师被引导去相信"生成逼真视频 = 理解物理世界", 而真正需要的物理精度研究被边缘化。
如 arXiv:2507.05169 所言:
"世界模型不是用来生成视频的, 而是用于推理和思想实验的沙盒。当前的大多数产品, 两者都不是。"
参考¶
↑ 上级 · World Model