物理理解机制与LLM世界模型之争¶
最后更新: 2026-04-14 | 深度调研
直觉物理: 人类核心能力¶
-
Spelke核心知识系统: 物体恒常性(3-4月婴儿), 连续性, 固体性, 支撑, 容纳
-
模型近似方式: 大量视频自监督学习, 隐式习得统计模式
"开普勒vs牛顿"关键发现(arXiv:2602.06923)¶
-
大多数世界模型默认学到"开普勒式曲线拟合"而非"牛顿式因果表征"
-
关键归纳偏置: 时间局部性(注意力窗口限2步)→力的编码R²达0.999
-
空间平滑性: 减少词汇量, 线性探针R²从0.86→1.0
WorldBench评估(arXiv:2601.21282)¶
-
425个物理精确视频, 132帧/视频
-
Cosmos-1 AR重力估计: 4.215 m/s²(真值9.81, 仅43%)
-
流体粘度: 所有模型全面失败
-
最差排序: 流体>重力参数>软体>多体交互>长尾材料
V-JEPA直觉物理¶
-
IntPhys准确率: 98%(vs GPT-4V/Gemini ~50%)
-
关键: 表示空间预测(惊异度)远优于像素预测
Othello-GPT完整链条¶
-
Li 2022: 非线性探针98.3%, 线性探针失败(20.4%)
-
Nanda 2023: 发现Mine/Yours编码→线性探针97-98%, 因果干预成功
-
ICLR 2025: 7个模型均达99%, 跨模型表征相似度93.1%
-
MATS 6.0: 发现"bag of heuristics"——局部规则集合而非统一算法
Melanie Mitchell批判¶
-
OthelloGPT更像托勒密本轮模型(曲线拟合)而非牛顿力学(因果发现)
-
非线性探针太强: 成功不等于真正编码了世界模型
-
关键方法论: 只有"线性探针成功 + 因果干预成功"才是强证据
曼哈顿导航(arXiv:2505.20874)¶
-
100x100网格, 道路扰动后第一步准确率骤降至11.85%
-
空间理解碎片化和局部化, 非全局连贯
-
结论: 统计记忆而非结构化世界模型
参考¶
↑ 上级 · 07 评估基准与指标体系