跳转至

世界模型的"皇帝新衣":视频生成 ≠ 物理理解

最后更新: 2026-04-17 | 本文是对整个调研的批判性反思

核心论点:大部分"世界模型"公司其实是视频生成公司换了名字。真正的物理理解几乎不存在。


一、三种定义,三个标准

Ha & Schmidhuber 2018: 工具性定义

  • 世界模型 = 智能体内部的压缩环境表征

  • 用途: 在"梦境"(潜在想象)中训练策略

  • 不要求物理正确性, 只要策略能优化即可

LeCun 2022: 因果认知定义

  • 世界模型 = 支持因果推理和反事实规划的心智模型

  • 明确反对像素级生成

  • "用像素预测来训练世界模型是一个糟糕的想法"

Hassabis / DeepMind: 物理精度定义

  • 世界模型必须理解物理和空间

  • 正在建立基准: 在模拟中验证单摆/滚球是否100%遵守牛顿定律

  • 承认 Veo 等视频模型"看起来逼真, 但不是物理级精确"

结论

三大定义都不支持"能生成逼真视频 = 世界模型"。Sora论文标题"Video Generation Models as World Simulators"是概念混淆的始作俑者。


二、视频生成 ≠ 物理理解: 六项铁证

证据 1: WorldBench 的量化打脸

重力加速度估计 (真值 9.81 m/s²):

  • Cosmos-1 AR: 4.215 ± 3.713 (误差 >50%)

  • WAN 2.2: 0.378 ± 0.784 (真值的 1/26)

  • CogVideoX: -0.039 (负值! 物体向上加速!)

流体粘度估计: 所有模型全面失败

  • 甘油(真值1.2 Pa·s): 模型估计 0.2-7.8

  • 蜂蜜(真值14.1 Pa·s): 模型估计 0.17->50, 跨3个数量级

WorldBench 结论: "视觉上真实的运动轨迹, 不遵从真实的运动参数"

证据 2: "开普勒 vs 牛顿" (arXiv:2602.06923)

  • 开普勒陷阱: Transformer 总是倾向学习曲线拟合而非因果机制

  • 两种模式在分布内预测精度几乎无差异, 分布外天壤之别

  • 打破陷阱需要: 空间平滑性 + 稳定性 + 时间局部性(最关键)

  • 结论: "简单的架构选择决定了AI是曲线拟合者还是物理学家"

证据 3: PhysBench (ICLR 2025 Oral)

  • 75 个 VLM, 10002 条物理推理测试

  • GPT-4o 比最好的开源模型高 20.7%, 但绝对分数仍远低于人类

  • VLM 在"常识"上好, 在"物理世界理解"上普遍失败

证据 4: OOD 误差高 35× (ICML 2025)

  • 分布内速度误差: 0.012

  • 分布外速度误差: 0.427 (高 35 倍!)

  • 扩大训练规模对 OOD 误差几乎没有改善

  • 模型的归纳优先级: 颜色 > 大小 > 速度 > 形状 (这不是物理的优先级!)

证据 5: 反事实推理 ≈ 随机猜测

  • GPT-4V 反事实问题: 39.8% (vs 事实性 83.1%)

  • 视频模型只能被动生成固定轨迹, 不支持"如果我做了X会怎样"

证据 6: arXiv:2507.05169《世界模型批判》

  • "当前系统普遍强调视频生成, 缺乏令人信服的理由"

  • World Labs 的 3D 产品"模拟没有动态agent、物理或交互的静态环境"

  • 严厉结论: 所有被调查系统都"不足以实现目标导向推理和规划"


三、真正的"物理"在哪里?

这些工作技术上更严谨, 但几乎没进入"世界模型"商业叙事。

Physics-Informed Neural Networks (PINNs)

  • 将 PDE 直接嵌入损失函数, 网络必须满足物理约束

  • 不从视频像素学习, 从守恒定律/PDE残差中学习

  • 这是根本性的方法论差异

PhyDNet (CVPR 2020)

  • 双分支: PhyCell(PDE约束) + 内容分支(非物理信息)

  • 在4个数据集超越SOTA

  • 显式物理约束 + 学习方法的结合

可微分物理引擎

  • DiffTaichi (MIT ICLR 2020): 可微编程, 10个物理模拟器

  • Brax (Google NeurIPS 2021): JAX, GPU大规模刚体

  • MuJoCo/MJX (DeepMind): 物理精确, JAX可微

  • NVIDIA Newton (2025): NVIDIA+Google+Disney联合, 专为机器人

这些工具的特点: 物理是硬编码的基本事实, 不是从数据猜测的。

GNN-Based 物理模拟

  • GNS (ICML 2020): 粒子图 + 消息传递, 比传统MPM快5000×

  • 加入动量守恒的物理信息GNN比纯数据驱动GNS显著更稳定 (Nature Communications 2025)

为什么这些没进入"世界模型"叙事?

  1. 商业化: 无法生成可视化内容, 不适合融资/媒体

  2. 评估分裂: FID/FVD (感知质量) vs MSE/守恒违反率 (物理精度), 两套指标从不对话

  3. 规模叙事: 显式物理约束的模型在规模上没有同等优势

  4. 领域割裂: PINNs 发在 J. Computational Physics; 世界模型发在 NeurIPS; 两个社区几乎不重叠


四、真正的世界模型需要什么?(六项能力)

1. 因果推理

  • 当前: 学"什么一起出现", 非"什么导致什么"

  • 分布内无法区分两者; 分布外天壤之别

2. 反事实推理

  • 当前: GPT-4V 反事实 39.8% ≈ 随机猜测

  • 需要: "如果我做了X, Y会怎样?"

3. 物体恒常性

  • 当前: 遮挡后物体消失/变形

  • 需要: 遮挡后仍存在且属性一致

4. 组合泛化

  • 当前: "苹果落地" + "球滚动" ≠ "苹果也会滚动"

  • 增加模板多样性(6→60)可降低异常率, 但这是暴力解法

5. 长程一致性

  • 当前: Genie 3 约1分钟; 物理定律在同一视频内可变

  • 需要: 重力不会中途改变

6. 交互性

  • 当前: 固定轨迹视频, 不支持动作响应

  • 需要: 对物理动作做出正确响应


五、谁在认真做?谁在蹭概念?

认真做的

  • Dreamer V1-V4: 在模拟器中验证因果预测, 合法性来自可测量的行为成功率(非视频画质)

  • LeCun / JEPA / AMI Labs: 非生成式, 表征空间, 最直接批评概念混淆

  • Causal-JEPA (arXiv:2602.11389): 物体级潜在干预, 诱导反事实效果

  • PINNs / PhyDNet / 可微引擎: 真正的物理, 但不在WM叙事中

  • 物理信息 GNN (Nature Communications 2025): 动量守恒约束

蹭概念的

  • Runway "GWM-1": Video Arena #1, 但衡量的是人类感知偏好, 与物理正确性无关

  • Sora "World Simulator": 标题是混淆的起源, OpenAI从未声称满足严格定义

  • 部分国内视频生成公司重新标签为"世界模型"

中间地带

  • NVIDIA Cosmos-Predict: 视频生成, WorldBench失败 → 偏蹭概念

  • NVIDIA Cosmos-Reason2: 明确以物理推理为目标, Physical AI Bench #1 → 偏认真

  • DeepMind Genie 3: 交互性真实, 物理从数据涌现, 但非精确 → 偏认真

  • Wayve GAIA-3: 域内物理一致性进步, 但离参数精确远 → 中间


六、为什么"物理"这么难?

信息论: 像素 → 物理是欠定反问题

  • 物理定律高度压缩 (F=ma 比任何训练视频都短)

  • 从像素运动推导力的作用 = 逆向工程

  • 同一像素运动可由无数不同力系统产生 (ill-posed)

  • 需要归纳偏置来解决欠定性

Pearl 因果层级

  • 第1层 关联(统计): "A发生时B倾向发生?" ← 视频生成模型在这里

  • 第2层 干预(因果): "如果我干预A, B会怎样?" ← 几乎没有模型到这里

  • 第3层 反事实(想象): "如果A不发生, B会怎样?" ← 0

像素重建损失无法引导模型到达因果层级。这不是规模问题, 是架构和训练目标的根本设计缺陷。

开普勒陷阱: 为什么不可避免?

  • 曲线拟合比因果发现更容易被梯度下降找到

  • 在训练损失上两者表现同等, 但搜索空间前者更小

  • 最优化压力永远引导模型走向最短曲线, 而非最简物理定律

三类解法方向

  1. 结构化归纳偏置: 时间局部性 / PDE约束 / 动量守恒

  2. 混合架构: 可微物理引擎 + 神经网络 / 符号回归(AI Feynman, PySR)

  3. 因果表征学习: Causal-JEPA / 物理作为因果发现的归纳偏置


七、全景对照表

真正的世界模型需要 vs 当前"世界模型"公司提供的:

  • 因果推理 → 统计相关学习

  • 物理参数精确 (g=9.81) → 视觉逼真 (g≈4.2 或 g=-0.04)

  • 反事实推理 → 分布内插值 (OOD误差高35×)

  • 组合泛化 → 案例记忆 (颜色>速度>形状优先级)

  • 交互性 (物理响应) → 固定轨迹视频生成

  • 长程一致性 → 几十秒到1分钟


八、这场混淆的代价

投资者、政策制定者、工程师被引导去相信"生成逼真视频 = 理解物理世界", 而真正需要的物理精度研究被边缘化。

如 arXiv:2507.05169 所言:

"世界模型不是用来生成视频的, 而是用于推理和思想实验的沙盒。当前的大多数产品, 两者都不是。"

参考


上级 · World Model