跳转至

07 评估基准与指标体系

最后更新: 2026-04-14


1. 评估框架现状

核心问题

如何形式化和评估生成模型是否"理解"了真实世界?目前没有统一框架。

— ICML 2025 Workshop: Assessing World Models

评估维度


2. 核心基准测试

2.1 WorldBench (2026.01, arXiv)

设计理念: 概念级、解耦评估 — 严格隔离和评估对单一物理概念/定律的理解。

两大子集:

2.2 Physics-RW

来源: 真实世界视频

覆盖范围:

  • 力学 (Mechanics)

  • 热力学 (Thermodynamics)

  • 电磁学 (Electromagnetism)

  • 光学 (Optics)

特色: 超越纯力学,提供全面的物理推理评估平台。

2.3 WorldScore (CVPR 2025 Workshop)

定位: 统一评估基准

评估维度:

  • 视觉质量

  • 物理法则遵守

  • 长程时间一致性

  • 动作条件化预测保真度

2.4 World Model Bench Workshop (CVPR 2025)

目标: 为世界模型评估建立标准化方法论

讨论的核心标准:

  • 物理正确性

  • 输入提示对齐

  • 泛化能力

  • 公平评估方法


3. 领域特定评估

3.1 自动驾驶

3.2 机器人/具身AI

3.3 游戏/交互环境

3.4 视频生成质量

3.5 世界知识评估


4. MBRL 专用基准


5. 评估中的开放问题

  1. 物理vs视觉: 视觉上逼真 ≠ 物理上正确。如何解耦评估?

  2. 交互性评估: 静态视频评估无法捕获交互质量

  3. 长程一致性: 目前缺乏分钟级甚至小时级一致性的标准化测试

  4. 因果vs相关: 模型是否真正理解因果关系,还是仅仅记住了视觉相关性?

  5. 计算成本: 评估本身的计算开销巨大

  6. 人类基线: 人类对物理世界的"直觉物理"本身就不完美,如何设定基线?


参考来源


上级 · World Model