07 评估基准与指标体系¶
最后更新: 2026-04-14
1. 评估框架现状¶
核心问题¶
如何形式化和评估生成模型是否"理解"了真实世界?目前没有统一框架。
— ICML 2025 Workshop: Assessing World Models
评估维度¶
2. 核心基准测试¶
2.1 WorldBench (2026.01, arXiv)¶
设计理念: 概念级、解耦评估 — 严格隔离和评估对单一物理概念/定律的理解。
两大子集:
2.2 Physics-RW¶
来源: 真实世界视频
覆盖范围:
-
力学 (Mechanics)
-
热力学 (Thermodynamics)
-
电磁学 (Electromagnetism)
-
光学 (Optics)
特色: 超越纯力学,提供全面的物理推理评估平台。
2.3 WorldScore (CVPR 2025 Workshop)¶
定位: 统一评估基准
评估维度:
-
视觉质量
-
物理法则遵守
-
长程时间一致性
-
动作条件化预测保真度
2.4 World Model Bench Workshop (CVPR 2025)¶
目标: 为世界模型评估建立标准化方法论
讨论的核心标准:
-
物理正确性
-
输入提示对齐
-
泛化能力
-
公平评估方法
3. 领域特定评估¶
3.1 自动驾驶¶
3.2 机器人/具身AI¶
3.3 游戏/交互环境¶
3.4 视频生成质量¶
3.5 世界知识评估¶
4. MBRL 专用基准¶
5. 评估中的开放问题¶
-
物理vs视觉: 视觉上逼真 ≠ 物理上正确。如何解耦评估?
-
交互性评估: 静态视频评估无法捕获交互质量
-
长程一致性: 目前缺乏分钟级甚至小时级一致性的标准化测试
-
因果vs相关: 模型是否真正理解因果关系,还是仅仅记住了视觉相关性?
-
计算成本: 评估本身的计算开销巨大
-
人类基线: 人类对物理世界的"直觉物理"本身就不完美,如何设定基线?
参考来源¶
↑ 上级 · World Model