跳转至

自动驾驶世界模型端到端技术

GAIA-2 世界模型架构图(原论文 arXiv:2503.20523 Figure 2)

GAIA-2 多视角生成结果(Figure 3)

最后更新: 2026-04-16 | 深度调研

Tesla FSD V13: 时序智能

15 秒时序缓冲区

  • 传统 FSD: 逐帧处理 (stateless)

  • V13: 维护 15 秒视频缓冲区, 处理"视频片段"

  • 递归式 10 秒视频缓冲 → 永久性 3D Voxel 地图

  • 端到端时序 Transformer: 跨帧注意力, 36 FPS (AI4/HW4)

占用网格 V3.0

  • 3D 空间体素化, 每体素分配占用概率

  • 体素分辨率提升 8×, 运行 36 FPS

  • 异形障碍物检测, 危险物检测距离 2×

  • HW3 (120英里/脱离) vs AI4 (450英里/脱离) 性能分化

Tesla 世界模拟器

  • Ashok Elluswamy (AI VP) 在 ScaledML 2026 披露

  • 统一架构: 同一视频生成网络, FSD + Optimus 共享

  • 36 Hz 闭环虚拟驾驶, 视觉上不可区分

  • 首次公开确认 FSD 和 Optimus 世界模型统一


Waymo EMMA (2024.10)

论文: arXiv:2410.23262

核心架构

  • 基于 Gemini 多模态大模型微调

  • 全文本表示: 所有输入/输出 → 自然语言 token

  • 轨迹点、检测框、路网 → 全部文本序列

CoT 推理 +6.7%

  • 端到端规划性能提升 6.7%

  • nuScenes L2 误差比 DriveVLM-Dual 降低 6.4%

  • 多任务联合训练: 轨迹 + 检测 + 路网共享 backbone

局限

  • 不支持 LiDAR/Radar (纯视觉)

  • 长视频序列能力有限

  • 研究阶段, 未用于 Waymo Rider 商业运营


Waymo World Model (2026.02)

  • 基于 Genie 3 + Waymo 驾驶场景适配

  • 输出: 摄像头画面 + LiDAR 点云 (多传感器联合)

  • 训练: 近 2 亿英里真实数据

三控制机制

  • 驾驶动作控制: 输入具体动作, 模拟反事实

  • 场景布局控制: 修改道路/信号灯/插入车辆行人

  • 语言控制: 文本调整天气时段, 生成全合成场景

可生成: 龙卷风、暴雪凌晨路口、野生动物穿行等极端场景


NVIDIA Alpamayo-R1: 首个开源推理 VLA

论文: arXiv:2511.00088

  • 10B 参数推理 VLA, 全球首个开源

  • Chain of Causation: 因果链推理 + 轨迹规划

  • 规划精度 +12%, 道路外率 -35%, 近距接触 -25%

  • RL 后训练推理质量 +45%

开源生态

  • 权重: HuggingFace (nvidia/Alpamayo-R1-10B)

  • 代码: GitHub (NVlabs/alpamayo)

  • 仿真: AlpaSim

  • 数据: Physical AI AV (1727小时, 25国, 2500+城市)

  • 每日 100 万次仿真测试, 10 万独特场景


合成数据策略: Tesla vs Waymo vs NVIDIA

Tesla: 数量 > 质量

  • 400万+ 车队自动产数, 每日 500 年等效驾驶

  • 神经世界模拟器补充边缘场景

  • 每轮训练 70,000 GPU 小时, 1.5 PB

Waymo: 质量 > 数量

  • 精标小规模真实数据 + World Model 亿级扩增

  • 近 2 亿真实英里 + 数十亿虚拟英里

NVIDIA: 工具链 > 私有数据

  • Cosmos Transfer + NuRec + LidarGen

  • 1727h 真实 + 百万/日虚拟测试

  • 开源生态, 任何 OEM 可接入

参考


上级 · 05 应用领域深度分析