LLM 内部世界模型之争¶
最后更新: 2026-04-16 | 深度调研
Othello-GPT 完整实验链条¶
起点: Kenneth Li et al. (2022) — 非线性探针¶
论文: arXiv:2210.13382 (ICLR 2023 Oral)
-
训练 8 层 GPT 预测 Othello 合法落子序列, 从未告知棋盘状态
-
探针: 双层 ReLU MLP (非线性), 作用于 Layer 7 残差流
-
结果: 非线性探针 ~98% 准确率; 线性探针仅 20.4%
-
干预实验: 修改内部激活 → 模型在新棋盘状态下输出合法落子
-
Li 的结论: 模型学会了涌现世界表示, 但是非线性压缩的
转折: Neel Nanda et al. (2023) — 线性探针突破¶
论文: arXiv:2309.00941 (BlackboxNLP @ EMNLP 2023)
关键洞察: Li 用 {黑,白,空} 分类; Nanda 发现模型用 {我方,对方,空} — 奇偶步符号翻转导致线性探针假失败
-
线性探针 Layer 6: ~99.5% 准确率 (vs Li 的 20.4%)
-
Layer 4 探针零样本迁移到 Layer 6: 说明棋盘状态 Layer 4 已完整编码
-
干预: 对 Layer 4 残差流探针方向取反 × 缩放(0-16) → 模型在任意(甚至非法)棋盘态输出合法落子
Nanda vs Li 学术争论:
-
Li: 非线性探针才是 ground truth
-
Nanda: 线性探针 + 因果干预 = "真正的内部表示"标准
-
核心分歧: 探针表达能力 ≠ 表示真实结构
反驳: MATS 6.0 "启发式规则包" (2024)¶
来源: LessWrong, 作者 jylin04 (Nanda MATS 6.0 暑期学员)
-
精细神经元级逆向工程
-
发现: OthelloGPT 通过许多独立局部决策规则计算, 而非全局一致的世界模型
-
例: MLP Neuron L1N421 编码 "若 A4 落子 AND B4 有棋 → 更新 B4+C4+D4"
-
规则不能泛化到棋盘平移 (位置特异)
-
结论: "一包独立启发式规则" (bag of heuristics), 非统一世界模型
深化: ICLR 2025 七模型实验¶
论文: arXiv:2503.04421
-
7 个模型: GPT-2 / T5 / BART / Flan-T5 / Mistral / LLaMA-2 / Qwen2.5
-
无监督 grounding 准确率 up to 99%
-
跨模型表征高度相似 (不同架构收敛到相同表示结构)
-
为 Othello 世界模型假说提供"迄今最强"证据
Manhattan 导航实验¶
论文: arXiv:2505.20874 (2025.05)
实验设置¶
-
100×100 网格模拟曼哈顿城市布局
-
POI 数量: 1024, 随机分布
空间感知探针 (绝对坐标预测)¶
-
X 坐标 MAE: 0.78 km, R² = 1.00
-
Y 坐标 MAE: 0.71 km, R² = 1.00
-
欧氏距离误差: 1.18 km
R² ≈ 1.00 意味着 LLM 隐状态的线性投影几乎完美预测全局坐标!
道路扰动实验 (3 类)¶
-
Road Perturbation: 首步准确率暴跌至 11.85% (高度敏感)
-
Distance Perturbation: 首步 58.79% (有一定鲁棒性)
-
Direction Perturbation: 目的地偏差最大 56.08 km (方向是核心)
结论: LLM 从局部描述构建全局一致的空间认知地图
Gurnee & Tegmark: 空间/时间神经元 (ICLR 2024)¶
论文: arXiv:2310.02207
-
模型: Llama-2 系列 (7B/13B/70B)
-
6 个数据集: 全球地点/美国地点/NYC + 历史人物/艺术品/新闻
-
发现: LLM 学会了空间和时间的线性表示
-
不同实体类型间统一 (城市和地标共享同一空间方向)
-
发现"空间神经元"和"时间神经元"
-
对 prompt 形式变化保持稳健
Melanie Mitchell 的批判 (2025.02)¶
来源: AI Guide Substack, LLMs and World Models Part 1 & 2
世界模型光谱 (引 Jacob Andreas)¶
静态查找表 → 地图 → 太阳系仪 → 模拟器
Part 1 核心¶
-
Sutskever (支持): LLM 学到"世界的压缩抽象表示"
-
LeCun (反对): LLM 本质是"近似检索"
-
历史反例: 皮肤病变分类器学到"标尺=恶性"
Part 2 核心 (针对 OthelloGPT)¶
-
看到 Nanda 线性探针后"相当震惊"
-
但 MATS 6.0 发现让她重新谨慎
-
最终类比: "托勒密本轮模型" — 有限范围内有效, 但非真正理解底层规律
当前共识与分歧¶
支持方证据¶
-
Othello-GPT: 7 个模型 99% grounding, 跨架构收敛
-
Manhattan: R²=1.00 空间坐标探针
-
Gurnee/Tegmark: 空间/时间神经元跨数据集稳健
-
ICLR 2024: 线性表示在不同 prompt 下持久
反对方证据¶
-
MATS 6.0: 局部规则集合, 非全局模型
-
Manhattan 扰动: 道路扰动首步准确率仅 11.85%
-
"Stochastic Parrot" (arXiv:2502.08946): SOTA LLM 物理概念落后人类 40%
方法论共识¶
-
非线性探针成功 ≠ 世界模型
-
只有"线性探针成功 + 因果干预成功"才是较强证据
-
简单任务 (Othello) 的涌现不能直接外推到真实世界物理理解
参考¶
↑ 上级 · 07 评估基准与指标体系