世界模型的数学基础¶
最后更新: 2026-04-16 | 公式推导级
ELBO 完整推导¶
从 Jensen 不等式出发¶
-
目标: 最大化边际对数似然 log p(x)
-
引入变分分布 q(z|x), Jensen 不等式得下界:
-
ELBO = E_q[log p(x|z)] - KL(q(z|x) || p(z))
-
间隙 = KL(q(z|x) || p(z|x)) >= 0
-
当推断网络精确匹配真实后验时 ELBO 紧
KL(q||p) vs KL(p||q)¶
反向 KL = 零强制 (Zero-Forcing)¶
-
p(x)≈0 处 q(x)>0 → log(q/p) 爆炸
-
优化器强制 q 集中在 p 有支撑的地方
-
结果: q 选择 p 的一个众数, 忽略其他
正向 KL = 零避免 (Zero-Avoiding)¶
-
p(x)>0 处 q(x)≈0 → log(p/q) 爆炸
-
优化器强制 q 覆盖 p 的所有众数
-
结果: q 铺开覆盖, 但拟合不精确
直觉图示¶
-
双峰分布 p: 峰A + 峰B
-
最小化 KL(q||p): q 只选峰A, 忽略峰B
-
最小化 KL(p||q): q 铺开覆盖两峰(过度分散)
VAE 后果¶
- VAE 用 KL(q||p) → 后验坍塌: 解码器太强时 q ≈ p(z)
Score Matching → DSM 等价性¶
Hyvärinen SM (2005)¶
-
学习 score function: s(x) ≈ ∇_x log p(x)
-
原始 SM 需要 Hessian, 计算昂贵
Vincent DSM 等价性 (2011)¶
-
对噪声核 q_σ(x̃|x) = N(x̃; x, σ²I):
-
DSM 目标 = SM 目标 (作用于噪声分布)
-
∇log q_σ(x̃|x) = -(x̃-x)/σ² (解析 score)
-
无需 Hessian, 只需预测去噪方向
-
DDPM 的 ε-prediction 正是 DSM 的实用化
Flow Matching 的 OT 视角¶
连续流基础¶
-
学习向量场 v(x,t), ODE: dx/dt = v(x,t)
-
x_0 ~ 噪声, x_1 ~ 数据
条件流匹配 (Lipman ICLR 2023)¶
-
无需模拟 (simulation-free): 回归条件向量场
-
对高斯条件路径: u_t = μ̇(z) + σ̇/σ·(x-μ)
OT-CFM: Wasserstein-2 最优传输¶
-
最优耦合: π* = argmin E[||x_0-x_1||²]
-
直线路径: x_t = (1-t)x_0 + tx_1, 目标速度 v* = x_1-x_0 (常数!)
-
最小化动能 ∫E||v_t||²dt (Benamou-Brenier)
-
推断只需极少 ODE 步 (10-50 vs DDPM 1000)
信息瓶颈与 VAE/JEPA 对应¶
Tishby IB (2000)¶
-
min I(X;Z) - β·I(Z;Y)
-
压缩 X → Z, 同时保留关于 Y 的信息
IB → VAE¶
-
重建目标: I(Z;Y) → E[log p(x|z)]
-
正则项: β·I(X;Z) → β·KL(q||p)
-
β-VAE 是 IB 的无监督版
IB → JEPA¶
-
JEPA 在表示空间预测, 不重建像素
-
隐式执行 IB: 压缩 context → Z, 保留目标相关信息
-
不需要显式 KL 正则, 通过 EMA + stop-gradient 防崩溃
率失真理论与 Tokenizer 设计¶
Shannon R(D)¶
-
R(D) = min I(X;X̂) s.t. E[d(X,X̂)] ≤ D
-
高斯源: R(D) = ½ log(σ²/D)
与 Tokenizer 的联系¶
-
词表大小 |V| 对应码率 R
-
重建质量 (perplexity) 对应失真 D
-
大词表 BPE: 率↑→失真↓ (符合 R-D 理论)
-
率失真感知三角形: R ↔ D ↔ P (感知质量)
MPPI: Feynman-Kac 路径积分推导¶
问题¶
-
系统: dx = f(x)dt + B(u dt + Σ^{½} dW)
-
目标: min E[φ(x_T) + ∫C(x,u)dt]
五步推导¶
-
随机 HJB PDE → 最优 u* = -λ B^T ∇V
-
指数变换 V = -λ log Ψ → 线性 PDE
-
Feynman-Kac: Ψ = E_Q[exp(-∫q/λ ds)]
-
最优控制的重要性采样表示
-
蒙特卡洛近似: u* ≈ Σ (w_k/Σw_j) ε_k, w_k = exp(-S(τ_k)/λ)
直觉¶
-
低代价轨迹获高权重 = 路径空间中的重要性采样
-
温度 λ→0 贪心, λ→∞ 均匀
-
GPU 并行 K=1000-10000 样本, ~10ms/step
参考¶
↑ 上级 · 02 技术架构与核心方法