跳转至

物理理解机制与LLM世界模型之争

最后更新: 2026-04-14 | 深度调研

直觉物理: 人类核心能力

  • Spelke核心知识系统: 物体恒常性(3-4月婴儿), 连续性, 固体性, 支撑, 容纳

  • 模型近似方式: 大量视频自监督学习, 隐式习得统计模式

"开普勒vs牛顿"关键发现(arXiv:2602.06923)

  • 大多数世界模型默认学到"开普勒式曲线拟合"而非"牛顿式因果表征"

  • 关键归纳偏置: 时间局部性(注意力窗口限2步)→力的编码R²达0.999

  • 空间平滑性: 减少词汇量, 线性探针R²从0.86→1.0

WorldBench评估(arXiv:2601.21282)

  • 425个物理精确视频, 132帧/视频

  • Cosmos-1 AR重力估计: 4.215 m/s²(真值9.81, 仅43%)

  • 流体粘度: 所有模型全面失败

  • 最差排序: 流体>重力参数>软体>多体交互>长尾材料

V-JEPA直觉物理

  • IntPhys准确率: 98%(vs GPT-4V/Gemini ~50%)

  • 关键: 表示空间预测(惊异度)远优于像素预测

Othello-GPT完整链条

  • Li 2022: 非线性探针98.3%, 线性探针失败(20.4%)

  • Nanda 2023: 发现Mine/Yours编码→线性探针97-98%, 因果干预成功

  • ICLR 2025: 7个模型均达99%, 跨模型表征相似度93.1%

  • MATS 6.0: 发现"bag of heuristics"——局部规则集合而非统一算法

Melanie Mitchell批判

  • OthelloGPT更像托勒密本轮模型(曲线拟合)而非牛顿力学(因果发现)

  • 非线性探针太强: 成功不等于真正编码了世界模型

  • 关键方法论: 只有"线性探针成功 + 因果干预成功"才是强证据

曼哈顿导航(arXiv:2505.20874)

  • 100x100网格, 道路扰动后第一步准确率骤降至11.85%

  • 空间理解碎片化和局部化, 非全局连贯

  • 结论: 统计记忆而非结构化世界模型

参考


上级 · 07 评估基准与指标体系