02 技术架构与核心方法¶
最后更新: 2026-04-26 | 技术架构深度解析
本文档对所有主流世界模型架构进行拆解:层数、参数、组件、连接方式、训练数据、复现路径。每个架构附带 Mermaid 结构图 + 关键超参表。
一、JEPA 家族(Joint Embedding Predictive Architecture)¶
LeCun 主导路线:不在像素空间预测,而在 latent embedding 空间预测。绕开生成式 reconstruction loss 的细节噪声 + 计算成本。共同范式:encoder 提 latent → predictor 学条件 latent → 用稀疏 mask(图像 / tubelet)形成 self-supervised 目标。
1.1 I-JEPA(图像 JEPA,Meta 2023)¶
论文: arXiv:2301.08243(CVPR 2023) | 代码: github.com/facebookresearch/ijepa
flowchart LR
img["Image<br/>224×224"]
enc["Context<br/>Encoder ViT-H"]
tgtenc["Target Encoder<br/>EMA of Context"]
pred["Predictor<br/>narrow ViT"]
loss["L2 latent loss"]
img --> enc
img --> tgtenc
enc --> pred --> loss
tgtenc --> loss
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class img,enc,tgtenc,pred,loss stage
关键超参数¶
| 项 | 值 |
|---|---|
| Backbone | ViT-H/14(embed 1280, depth 32) |
| 输入分辨率 | 224×224 |
| Patch grid | 14×14 = 196 patches |
| Context block | 1 个,覆盖 ~85% 图 |
| Target blocks | 4 个,每个覆盖 15-20% |
| Target encoder | EMA copy of context(momentum 0.996→1.0) |
| Predictor | 6-layer ViT, embed 384 |
| Loss | L2 in latent space |
| Optimizer | AdamW(lr 1e-3, warmup 40 epoch) |
训练与复现¶
- 数据:ImageNet-22k(14M 图)
- 训练步:300 epoch ≈ 600 H100·hr
- 复现:Meta 官方仓,单 V100 8GB 起步可跑 ViT-S
- 预训练后用 linear probe / fine-tune 评 ImageNet-1K top-1 ≈ 76.5%(ViT-H/14)
1.2 V-JEPA 2(视频 JEPA,Meta 2025.06)¶
论文: arXiv:2506.09985 | 1.2B 参数 + 动作条件训练
flowchart LR
vid["Video<br/>64×384²"]
tubelet["3D Tubelet<br/>Embed t=2,h=16,w=16"]
enc["Context Enc<br/>ViT-1.2B"]
tgt["Target Enc<br/>EMA"]
pred["Predictor<br/>+ action cond"]
act["Action<br/>(GR-2 etc)"]
loss["L2 latent"]
vid --> tubelet --> enc --> pred
vid --> tgt
act --> pred
pred --> loss
tgt --> loss
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class vid,tubelet,enc,tgt,pred,act,loss stage
V-JEPA → V-JEPA 2 对比¶
| 维度 | V-JEPA (2024) | V-JEPA 2 (2025) |
|---|---|---|
| 参数 | 600M | 1.2B |
| 输入 | 16 帧@224² | 64 帧@384²(渐进) |
| 动作条件 | 无 | ✅ AC-Predictor 第二阶段加入 |
| 训练时长 | 90K 迭代 | 90K → 252K(两阶段) |
| 直觉物理 IntPhys | 71.5% | 86.3% |
| 下游 robot manipulation | 弱 | 直接做 Goal-Conditioned MPC |
训练流程(两阶段)¶
- 阶段一(无动作 SSL):90K → 252K 迭代,16 帧@256² → 64 帧@384² 渐进(节省 8.4× GPU 时间)
- 阶段二(动作条件):冻结 encoder,训练 AC-Predictor,教师强制 + 多步展开损失(T=2)
- 规划:Goal-Conditioned MPC + CEM 采样,16 秒/动作
1.3 LeWorldModel (LeWM, 2026.03)¶
论文: arXiv:2603.19312 | LeCun/AMI Labs 首个端到端 JEPA, 15M 参数单 GPU
flowchart LR
obs["Observation"]
enc["Encoder<br/>ResNet-18"]
pred["Latent<br/>Predictor"]
sigreg["SIGReg<br/>(no collapse)"]
plan["Planning<br/>(latent MPC)"]
obs --> enc --> pred --> sigreg
pred --> plan
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class obs,enc,pred,sigreg,plan stage
SIGReg 核心创新¶
JEPA 训练老问题是 representation collapse(encoder 学到全 0 / 常数 latent 也能让 predictor loss 为 0)。常规解:EMA target encoder 制造非对称性;VICReg 加方差/协方差正则。
LeWM 提出 SIGReg (Spectral Information Gap Regularizer):
- 直接约束 latent 的奇异值谱接近均匀分布
- 不需要 EMA target,不需要预测器对称
- 单 GPU 15M 参数也能训稳
意义:JEPA 的"小 model 也能 work"路径,Meta 之前都需要 ViT-H/L 大 backbone。
二、Dreamer 家族(Model-Based RL)¶
Dreamer 路线:在 latent space 学 RSSM 世界模型 + 用 imagination rollout 训 actor-critic。跟 JEPA 区别在于为 RL 设计(有 reward / value head)而非 SSL pretext。
2.1 Dreamer V3 (2023 Nature)¶
论文: arXiv:2301.04104 | 代码: github.com/danijar/dreamerv3 | 单配置跨 150+ 任务
flowchart LR
obs["Obs"]
enc["CNN Enc"]
rssm["RSSM<br/>h_t = GRU<br/>z_t = Categorical"]
head["Reward / Value /<br/>Cont / Decoder"]
actor["Actor"]
img["Imagination<br/>H=15"]
obs --> enc --> rssm --> head
rssm --> img --> actor
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class obs,enc,rssm,head,actor,img stage
模型尺寸选项¶
| 尺寸 | params | RSSM hidden | latent dim | 适用 |
|---|---|---|---|---|
| XS | 8M | 256 | 32×32 | 玩具任务 |
| S | 18M | 512 | 32×32 | DMC / Atari |
| M | 37M | 768 | 32×32 | DMC Hard / Crafter |
| L | 77M | 1024 | 32×32 | Atari-100k 完整 |
| XL | 200M | 1536 | 32×32 | Minecraft Diamond |
关键训练超参(所有任务共享)¶
| 项 | 值 |
|---|---|
| Imagination horizon | 15 |
| KL balance | dyn 0.5, rep 0.1 |
| Reward / value loss | symlog two-hot |
| Actor entropy | η=3e-4 |
| Optimizer | LaProp |
| Learning rate | 1e-4 |
| Replay ratio | 1(DMC)/ 32(Atari) |
Symlog 变换¶
symlog(x) = sign(x) · ln(|x| + 1)
symexp(x) = sign(x) · (exp(|x|) - 1)
# Two-Hot 编码(reward / value 输出离散化):
# 给定目标 v, 找相邻桶 b_k ≤ v ≤ b_{k+1}
# w_k = (b_{k+1} - v) / (b_{k+1} - b_k)
# w_{k+1} = 1 - w_k
# 预测 v̂ = Σ_i p_i · symexp(b_i)
2.2 Dreamer V4 (2025.10)¶
论文: arXiv:2509.24527 | 2B 参数, 首次大规模预训练 WM, 纯离线解决 Minecraft Diamond
flowchart LR
vid["Video<br/>+ action"]
tok["VQ-VAE<br/>tokenize"]
bct["Block-Causal<br/>Transformer 192L"]
flow["Flow Matching<br/>decoder"]
rl["RL via<br/>imagination"]
vid --> tok --> bct --> flow
bct --> rl
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class vid,tok,bct,flow,rl stage
V3 → V4 对比¶
| 维度 | V3 | V4 |
|---|---|---|
| Backbone | RSSM (GRU) | Block-Causal Transformer 192 层 |
| 参数 | 200M (XL) | 2B |
| Tokenizer | CNN encoder | VQ-VAE patch token |
| Decoder | MSE reconstruction | Flow Matching |
| Attention | 无 | GQA (Q=16, KV=4) |
| 训练范式 | online RL | 纯离线 + RL via imagination |
| Minecraft Diamond | 需 online | 纯离线 4-shot |
| 推理速度 | 50ms/step | 13ms/step(H100, ~50× 加速) |
2.3 TD-MPC2(2024)¶
论文: arXiv:2310.16828 | 官网: tdmpc2.com | 无解码器, 潜空间 MPPI 规划
flowchart LR
s["State"]
enc["Encoder"]
z["Latent z"]
dyn["Dynamics<br/>z_{t+1} = f(z, a)"]
Q["Q-function"]
plan["MPPI<br/>plan in z"]
s --> enc --> z --> dyn
z --> Q
dyn --> plan
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class s,enc,z,dyn,Q,plan stage
特色:
- 无解码器 —— 不需要重建观察,pure latent dynamics
- 潜空间用 MPPI (Model Predictive Path Integral) 采样规划
- 单一架构 + hyperparam 跨 100+ 任务(DMC / Meta-World / ManiSkill)
- 5M-317M 参数全 scale,公开权重
2.4 IRIS (ICLR 2023)¶
论文: arXiv:2209.00588
flowchart LR
obs["Image obs"]
vqvae["VQ-VAE<br/>tokenize"]
trans["Transformer<br/>autoregress"]
rl["Actor + Critic"]
obs --> vqvae --> trans --> rl
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class obs,vqvae,trans,rl stage
特色:
- 把世界模型当成 autoregressive next-token 任务(VQ-VAE token 化 + GPT-2 small)
- Atari-100k 中位 HNS 0.289,9/26 超人类
- 在低数据制度(100k frames)优于 Dreamer V3,是 Dreamer V4 的灵感来源之一
三、NVIDIA Cosmos 平台¶
论文: arXiv:2501.03575 | 开源: github.com/nvidia-cosmos | 9000 万亿 token / 2000 万小时视频
NVIDIA 把"为机器人 / 自动驾驶训练"作为目标,自上而下做整套世界模型 stack(tokenizer + predictor + transfer + reasoner)。
3.1 Cosmos Tokenizer¶
flowchart LR
vid["Video<br/>HxWxT"]
enc["3D Causal CNN<br/>Encoder"]
quant["FSQ / Continuous<br/>(8-bit)"]
dec["3D CNN<br/>Decoder"]
out["Reconstructed"]
vid --> enc --> quant --> dec --> out
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class vid,enc,quant,dec,out stage
Tokenizer 规格与性能¶
| 变体 | 压缩比 | rFVD ↓ | 用途 |
|---|---|---|---|
| CV8x8x8 | 512× | 13.4 | 连续 latent,feed predictor |
| DV8x8x8 | 512× | 17.8 | discrete token, 用于 AR 模型 |
| CV4x8x8 | 256× | 6.9 | 高质量 reconstruction |
| DV4x16x16 | 1024× | 32.1 | 极致压缩(端侧) |
vs OpenSora / WALT / VideoLDM 等公开 tokenizer,rFVD 普遍下降 30-50%。
3.2 Cosmos-Predict¶
flowchart LR
cond["Cond<br/>(text/img/action)"]
tok["Token-level<br/>diffusion"]
pred["Future<br/>tokens"]
detok["Detokenize<br/>→ video"]
cond --> tok --> pred --> detok
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class cond,tok,pred,detok stage
Cosmos-Predict 模型矩阵¶
| 版本 | 参数 | 输入条件 | 用途 |
|---|---|---|---|
| Predict1-7B | 7B | 文本 / 单帧图 | 通用视频生成 |
| Predict1-14B | 14B | 同上 | 高质量 |
| Predict2-2B | 2B | + action | 机器人小模型 |
| Predict2.5-7B | 7B | + LiDAR / map | 自动驾驶 |
3.3 Cosmos-Transfer(结构控制)¶
flowchart LR
src["Source video"]
edge["Edge / Depth /<br/>Segmentation"]
cond["Conditioning"]
tgt["Stylized<br/>output"]
src --> edge --> cond --> tgt
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class src,edge,cond,tgt stage
Transfer2.5-2B vs Transfer1-7B: 模型缩小 3.5×, 自动驾驶检测精度提升最高 60%。
3.4 Cosmos-Reason 系列¶
flowchart LR
vid["Video"]
enc["Vid Encoder"]
llm["LLM Decoder<br/>(56B)"]
out["Physical /<br/>Embodied reasoning"]
vid --> enc --> llm --> out
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class vid,enc,llm,out stage
Reason1 四阶段训练¶
- 视频-文本对齐预训练(CLIP-style)
- Vision-language SFT(COCO / VQA / 物理 QA)
- Reasoning RL(rule-based reward on physics QA)
- Embodied SFT(机器人/驾驶场景任务)
Reason1-56B: 物理常识 60.2% vs OpenAI o1 59.9%; 具身推理 63.7%。
3.5 训练基础设施¶
| 维度 | 详情 |
|---|---|
| 原始数据 | 2000 万小时视频 |
| Token 总量 | 9000 万亿 tokens |
| 片段数 | 1 亿 (2-60 秒) |
| Predict2.5 额外 | 2 亿精选片段 |
| 数据管线 | NeMo Curator |
| 吞吐 | PyNvideoCodec + Ray 提升 6.5× |
| 训练算力 | 10,000 × H100 × 3 个月 |
四、DeepMind Genie 系列¶
DeepMind 路线:纯生成式世界模型用作可玩游戏环境。Genie 是 Google "playable video model" 路线代表。
4.1 Genie 1 (2024.02)¶
论文: arXiv:2402.15391
flowchart LR
vid["Video<br/>frames"]
st_vit["ST-ViViT<br/>spatial-temp"]
lam["LAM<br/>Latent Action<br/>(8 codebook)"]
dyn["Dynamics<br/>MaskGIT"]
out["Next frame"]
vid --> st_vit --> dyn
vid --> lam --> dyn
dyn --> out
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class vid,st_vit,lam,dyn,out stage
Genie 1 规格¶
| 项 | 值 |
|---|---|
| 参数 | 11B |
| 训练数据 | 2D platformer 视频,~942B token |
| 输出 | 1 frame autoregressive |
| Latent action codebook | 8 个离散动作 |
| 推理 | MaskGIT 离散 + cosine schedule |
| 任务 | 输入 1 帧 + latent action → 生成下一帧 |
4.2 Genie 2 (2024.12) / Genie 3 (2025.08)¶
⚠️ DeepMind 未公开完整技术论文,以下基于公开博客 / 演示。
flowchart LR
img["Single image<br/>(scene)"]
g["Genie 2/3"]
play["Playable<br/>1-min env"]
img --> g --> play
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class img,g,play stage
Genie 1→2→3 演进¶
| 维度 | Genie 1 | Genie 2 | Genie 3 |
|---|---|---|---|
| 输入 | 单帧 + action | 单图 → 3D world | 文本 + 单图 |
| 输出 | 2D 平台游戏 | 任意场景互动 | 高清持久世界 |
| 持续时长 | ~10 秒 | ~30 秒 | 1 分钟 |
| 分辨率 | 256² | 720p | 720p+ |
| 公开度 | paper | blog only | blog + demo |
五、扩散路线(视频/驾驶世界模型)¶
跟 Cosmos / Genie 一样的"生成式"路线,但用扩散模型作为核心 architecture。重点覆盖自动驾驶场景。
5.1 GAIA-2 (Wayve 2025.03)¶
论文: arXiv:2503.20523
flowchart LR
cam["6-cam input"]
vae["3D VAE"]
diff["Diffusion<br/>Transformer"]
rec["Reconstruction<br/>+ multi-view"]
cam --> vae --> diff --> rec
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class cam,vae,diff,rec stage
GAIA-2 多视角一致性¶
- 训练时 6 个 camera 视角联合采样
- 视角间通过 cross-attention 共享 latent
- 推理时支持任意视角组合(前后左右等)
GAIA-2 训练参数¶
| 项 | 值 |
|---|---|
| 视频源 | 25M 真实驾驶视频 |
| 时长 | 平均 30 秒 / clip |
| 分辨率 | 256×512 (per cam) |
| 训练算力 | 2500+ GPU·days |
| 主要场景 | 英国 + 美国 + 德国驾驶 |
5.2 GAIA-3 (2025.12)¶
GAIA-3 新能力:
- World-on-Rails:固定场景只改自车(评测专用)
- 反事实碰撞生成:LiDAR 对齐
- 体化迁移:从仿真迁移到真实
- 受控视觉多样性:天气 / 时间显式控制
- 罕见失败模式扩增:合成 long-tail 场景
5.3 DIAMOND (NeurIPS 2024)¶
论文: arXiv:2405.12399
flowchart LR
s["State / Action"]
edm["EDM Diffusion<br/>(Heun n=3)"]
next["Next obs"]
rl["Train policy<br/>in dream"]
s --> edm --> next --> rl
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class s,edm,next,rl stage
DIAMOND vs GameNGen 对比¶
| 维度 | GameNGen (DDPM) | DIAMOND (EDM) |
|---|---|---|
| 扩散核心 | DDPM | EDM(Karras 2022 改进) |
| 推理步 | ~50 | 3(Heun 求解器) |
| Atari-100k HNS | 1.06 | 1.46 |
| 训练能力 | atari 部分游戏 | 11 个游戏超人类 |
| FPS | ~10 | ~30 |
DIAMOND 是世界模型训练智能体中最优。
六、训练范式总览与复现资源¶
训练范式对比¶
| 路线 | 代表 | 输入 | 输出 | 核心 loss | 是否需要 reward |
|---|---|---|---|---|---|
| JEPA SSL | I-JEPA / V-JEPA 2 / LeWM | 图像 / 视频 | latent | L2 (latent) | 否 |
| Dreamer RL | Dreamer V3/V4 / TD-MPC2 | obs + reward + action | latent + Q | KL + BCE | 是 |
| Token AR | IRIS / Genie | discrete token | next token | CE | 仅 RL phase |
| Diffusion | GAIA-⅔ / DIAMOND / Cosmos | 视频 | 视频 | denoising MSE | 仅 RL phase |
复现资源索引¶
| 架构 | 公开权重 | 公开训练代码 | 单 GPU 可跑 |
|---|---|---|---|
| I-JEPA | ✅ ViT-H/14 | ✅ | ❌(需 8×A100) |
| V-JEPA 2 | ✅ 1.2B | 部分 | ❌ |
| LeWM | ✅ 15M | ✅ | ✅(消费级 GPU) |
| Dreamer V3 | ✅ 全 size | ✅ | ✅(XS/S 单 GPU) |
| Dreamer V4 | 部分 | 待公开 | ❌(2B 需多卡) |
| TD-MPC2 | ✅ 全 size | ✅ | ✅ |
| IRIS | ✅ | ✅ | ✅ |
| Cosmos | ✅ tokenizer + Predict1 | ✅ | 部分 |
| Genie 1 | ❌ | ❌ | — |
| GAIA-2 | ❌ | ❌ | — |
| DIAMOND | ✅ | ✅ | ✅ |
实操起步建议:
- 想做 SSL → V-JEPA 2 base + 单 8×A100,1 周训出 small variant
- 想做 RL → Dreamer V3 S 配置 + DMC,单 V100 8GB 三天
- 想做生成 → DIAMOND 玩具版(Atari),单 GPU 一周
- 想做工业级 driving → Cosmos Predict2.5 finetune(公开权重 + 自家数据)
↑ 上级 · World Model