文章

WorldScore:统一世界模型评测基准

WorldScore:统一世界模型评测基准——从静态图像到动态视频、从感知到物理一致性。

WorldScore:统一世界模型评测基准

一、什么是世界模型?

在人工智能研究中,”在脑海中预演世界”的能力,被概括为一个核心概念——世界模型(World Model)

学术界通常将其定义为:

世界模型是智能体对其所处环境的状态结构、演化规律及潜在因果关系的内部表征,用于支持预测、推理与决策。

世界模型并不是简单的记忆,也不只是统计相关性的堆砌,而是对”环境如何运作”的一种内部理解机制。

它使得模型能够 预测未来、进行规划、减少试错,并在复杂环境中做出更具前瞻性的决策

1.1 世界模型的三个核心组件

一个完整的世界模型通常包含三个核心组件,它们如同大脑的三个功能区,各司其职又紧密协作:

1
2
3
4
5
6
7
8
9
10
11
12
13
┌─────────────────────────────────────────────────────────┐
│                    世界模型架构                          │
│                                                         │
│  ┌──────────────┐   ┌──────────────┐   ┌─────────────┐ │
│  │  状态表征模型  │──▶│   动态模型    │──▶│  决策模型   │ │
│  │ State        │   │  Dynamics    │   │  Decision   │ │
│  │ Representation│   │  Model       │   │  Model      │ │
│  └──────────────┘   └──────────────┘   └─────────────┘ │
│         │                  │                  │        │
│         ▼                  ▼                  ▼        │
│    观测 → 内部状态    状态+动作 → 下一状态    状态 → 最优动作│
│   (图像/传感器)      (s_t, a_t → s_{t+1})   (s → a)    │
└─────────────────────────────────────────────────────────┘
组件功能类比
状态表征模型从高维噪声观测(图像、传感器)中提炼紧凑的内部状态人脑将视觉信号转化为”房间布局”的认知
动态模型给定当前状态和动作,预测环境未来状态变化“如果我向前走两步,会撞到桌子”
决策模型基于内部推演,选择最优行动路径“所以我应该向左绕行”

1.2 世界模型 vs 传统图片/视频生成式模型

核心区别: 传统图片/视频生成式模型只关心”下一帧长什么样”,世界模型还关心”世界为什么这样运转”。

  • 生成式模型:只有像素到像素的映射, 没有对世界的内部理解 。它学到的是”统计数据相关性”,不知道物体在 3D 空间中如何存在。

  • 世界模型:内部维护了显式的 3D 状态表征 (点云、网格等),理解世界的几何结构和物理规律 ,可以接受精确的物理参数(如相机矩阵)作为硬约束。

CogVideoX 的架构(生成式模型)

  • ✅ 只有2D模块:VAE Encoder/Decoder + DiT + Text Encoder
  • ❌ 无3D模块:没有深度估计、点云、相机渲染
  • ❌ 无几何约束:帧间一致性靠 DiT 的 attention 隐式建模
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
┌─────────────────────────────────────────────────┐
│              CogVideoX 架构(2D → 2D)            │
│                                                 │
│  输入:图片 + 文字prompt                          │
│    │           │                                │
│    ▼           ▼                                │
│  VAE Encoder  T5 Text Encoder                   │
│  (2D→latent)  (text→token)                      │
│    │           │                                │
│    └─────┬─────┘                                │
│          ▼                                      │
│  ┌──────────────────┐                          │
│  │ Diffusion        │  ← 核心:2D Transformer   │
│  │ Transformer(DiT) │     在2D潜在空间去噪       │
│  └──────────────────┘                          │
│          │                                      │
│          ▼                                      │
│  VAE Decoder (latent→2D)                        │
│          │                                      │
│          ▼                                      │
│  输出:49张2D视频帧                               │
└─────────────────────────────────────────────────┘

WonderJourney 的架构(世界模型)

  • ✅ 有3D感知模块:Midas深度估计
  • ✅ 有3D表征模块:KeyframeGen 点云构建
  • ✅ 有3D渲染模块:PerspectiveCameras(4×4矩阵驱动)
  • ✅ 有几何约束:点云保证不同视角下物体一致
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
┌──────────────────────────────────────────────────────┐
│            WonderJourney 架构(2D → 3D → 2D)          │
│                                                      │
│  输入:首帧图片 + 4×4相机矩阵序列                       │
│    │                    │                            │
│    ▼                    │                            │
│  ┌──────────────────┐   │                            │
│  │ LDM (Midas)      │   │  ← 3D感知模块              │
│  │ 深度估计          │   │     2D图片→深度图           │
│  └──────────────────┘   │                            │
│    │                    │                            │
│    ▼                    │                            │
│  ┌──────────────────┐   │                            │
│  │ KeyframeGen      │   │  ← 3D表征模块              │
│  │ 点云构建          │   │     首帧+深度→3D点云        │
│  └──────────────────┘   │                            │
│    │                    │                            │
│    ▼                    ▼                            │
│  ┌──────────────────────────────┐                    │
│  │ PerspectiveCameras 渲染      │  ← 3D渲染模块      │
│  │ 3D点云 + 4×4矩阵 → 2D新视角   │     矩阵硬约束     │
│  └──────────────────────────────┘                    │
│    │                                                 │
│    ▼                                                 │
│  ┌──────────────────┐                               │
│  │ KeyframeInterp   │  ← 扩散补全                   │
│  │ 空洞修复          │     新视角可能有空洞            │
│  └──────────────────┘                               │
│    │                                                 │
│    ▼                                                 │
│  输出:多视角2D图片                                    │
└──────────────────────────────────────────────────────┘

1.3 世界模型应用领域

世界模型技术正从学术研究走向商业落地,在多个领域催生了具体的应用场景。以下按通用基础型领域专用型进行梳理,并给出每个领域的具象化商业应用案例。

【通用基础型世界模型】

核心诉求:构建世界基础模型平台,提供通用的世界模拟能力,可服务于多个领域。

企业 / 组织代表模型特点论文
Google DeepMindGenie 3通用世界模型,支持实时交互720p@24fpshttps://deepmind.google/models/genie/
MetaV-JEPA 2开源 JEPA 架构,1/50算力追平生成式世界模型https://arxiv.org/abs/2506.09985

具象化商业应用场景

  • 游戏开发:输入一句话自动生成可探索的3D游戏关卡,设计师只需调整而非从零搭建
  • 教育训练:生成分手术场景的虚拟环境,医学生在虚拟手术室反复练习复杂术式
  • 影视预可视化:导演输入剧本描述,快速生成场景预览,替代昂贵的手绘分镜
  • 数字孪生:为工厂、城市生成实时映射的虚拟副本,用于仿真推演和决策优化

【自动驾驶领域】

核心诉求:生成极端场景与仿真闭环训练,解决长尾数据匮乏痛点

企业 / 组织代表模型特点论文
高德(联合北邮)FantasyWorld几何一致性世界建模,WorldScore-Static得分榜首,单次前向传播同时输出视频+3D结构https://arxiv.org/abs/2509.21657
WayveGAIA-1 / GAIA-2首个面向自动驾驶的生成式世界模型,5摄像头多视角时空一致性https://arxiv.org/abs/2503.20523
小鹏 / 理想VLA 2.0 / MindVLA-o1VLA路线的物理世界大模型,将世界模型作为感知与预测的底层能力集成进端到端架构https://arxiv.org/abs/2510.14902
DriveDreamerDriveDreamer系列学术界专为自动驾驶设计的视频世界模型https://arxiv.org/abs/2403.06845

具象化商业应用场景

  • 极端场景生成:自动生成”暴雨天立交桥逆行老头乐”“大雪覆盖乡村土路突然窜出野猪”等现实中几乎无法采集的Corner Case,用于训练自动驾驶算法
  • 云端仿真训练场:高德FantasyWorld基于7亿月活用户的真实轨迹数据,在虚拟世界凭空造出无数复杂路况,车企无需实车跑几亿公里碰运气,直接在云端完成数十亿公里训练
  • 路测替代:新手司机拿到驾照前,先在世界模型生成的虚拟城市里练习100小时,覆盖各种天气和路况
  • 事故复现:输入事故数据,世界模型反推并生成事故全过程的多视角视频,用于责任认定和保险理赔

【具身智能领域】

核心诉求:虚拟试错训练,让机器人在数字世界学会技能后再进入现实

企业 / 组织代表模型特点论文
Physical Intelligenceπ0.7机器人通用基础模型,首次实证”组合泛化”——把已学技能重新组合完成新任务,被称为机器人领域的”GPT-3时刻”https://arxiv.org/abs/2604.15483
清华大学Motus统一潜在动作世界模型,专为机器人动作规划,将视觉、语言、动作统一到潜在空间https://arxiv.org/abs/2512.13030

具象化商业应用场景

  • 家庭服务机器人:π0.7已实现零样本叠衣服、操作咖啡机、用空气炸锅烤红薯——机器人不用为每个任务单独训练,通过语言指导就能完成从未见过的家务
  • 工业柔性制造:机械臂通过世界模型预演”把易碎品装入盒子”的动作序列,在虚拟环境试错1000次后再操作真实物体,废品率降低90%
  • 仓储物流:分拣机器人面对从没见过的商品包装,世界模型帮助它预判”这个形状该怎么抓”再出手
  • 危险作业:排爆机器人在世界模型生成的虚拟爆炸物场景中反复训练,真实操作时成功率从30%提升到95%

【虚拟现实领域】

核心诉求:生成可交互、可编辑、可探索的3D世界

企业 / 组织代表模型特点论文/链接
World Labs (李飞飞)Marble3D高斯点云表征,可导出可编辑,融资2.3亿美元,专为生成持久化3D世界设计https://marble.worldlabs.ai/
腾讯混元HY-World 2.02026年4月开源,支持文/图/视频输入,直接生成可导入Unity/UE的可编辑3D资产(Mesh/3DGS),而非一次性视频https://arxiv.org/abs/2604.14268

具象化商业应用场景

  • 游戏开发:腾讯HY-World 2.0输入一张草图或一句话,直接生成可走进去探索的3D游戏关卡,资产可导入Unity/UE二次编辑,关卡原型开发周期从2周缩短到2小时
  • 影视制作:导演说”赛博朋克雨夜街道”,世界模型生成完整3D场景,摄影师在其中自由运镜拍摄,替代昂贵的实景搭建
  • 室内设计预览:设计师输入户型图,世界模型生成可漫游的装修效果,客户戴上VR头显走进”未来的家”再决定签不签合同
  • 文化遗产保护:对古建筑多视角拍摄,世界模型生成高精度数字孪生,永久保存并在虚拟空间开放参观
  • VR社交:用户创建自己的虚拟家园,朋友来访时看到的是持续存在、可交互的3D世界,而非每次重新生成的临时场景

二、WorldScore:统一世界模型评测基准

官网:https://haoyi-duan.github.io/WorldScore/

GitHub:https://github.com/haoyi-duan/WorldScore

Dataset:https://huggingface.co/datasets/Howieeeee/WorldScore

2.1 为什么需要 WorldScore?

在世界模型概念火热的同时,一个尴尬的问题是:

3D 生成模型、4D 生成模型、视频生成模型三条技术路线,输出形态不同,评价标准各异,无法公平比较。

  • 3D 模型:输出点云/网格

  • 4D 模型:输出带时间维度的 3D 序列

  • 视频模型:输出 2D 帧序列

WorldScore 的核理念是:把所有世界生成模型放进同一个”下一场景生成(Next-Scene Generation)”框架里,用统一的相机轨迹和场景数据集评测。

2.2 核心指标:Static 与 Dynamic

WorldScore 设立了两个核心指标,分别考核世界模型的两种基础能力:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
                    WorldScore 统一评测
                          │
            ┌─────────────┴─────────────┐
            ▼                           ▼
    WorldScore-Static            WorldScore-Dynamic
    (静态世界得分)                (动态世界得分)
    ┌───────┴───────┐           ┌───────┴───────┐
    │ • 相机控制     │           │ • 运动准确性    │
    │ • 物体控制     │           │ • 运动幅度     │
    │ • 内容对齐     │           │ • 运动平滑性   │
    │ • 3D 一致性   │           └───────────────┘
    │ • 光度一致性   │
    │ • 风格一致性   │
    │ • 主观质量     │
    └───────────────┘
    
# WorldScore-Static 是基石,它代表了 AI 对空间结构的理解。
# WorldScore-Dynamic 是进阶,它代表了 AI 对物理规律的模拟

数据集样例和指标

worldscore-data-sample

2.3 WorldScore 评测软件架构

WorldScore 通过 “统一落盘格式 + 统一调度框架 + 插件化模型/指标” 的架构,目前共计支持 23 个模型评测。

  • 生成侧:adapter 屏蔽模型差异,统一落盘文件和格式(frames/ + camera_data.json + image_data.json + input_image.png )。
  • 评测侧:不感知模型区别,只读统一格式,按 type(prompt/base/camera)三分支调度。
  • 指标侧:每个 metric 的 compute_scores() 是插件,外部评测调度模块不感知每个 metric 内部算法。

worldscore-framework


三、世界模型评测五大 Benchmark 横向对比

2025-2026 年,多个团队从不同角度切入世界模型评测领域,形成了覆盖通用视频、统一生成、自动驾驶、具身智能、物理推理的五条主线。

3.1 五大 Benchmark 一览

Benchmark核心评测维度适用场景
WorldModelBench指令跟随、常识、物理遵守通用视频世界模型
WorldScore可控性、质量、动态(10 维度)3D/4D/视频统一比较
WorldLens生成、重建、行为遵循、下游任务、人类偏好自动驾驶
WorldArena 2.0感知质量 + 功能效用(数据引擎/策略评估/动作规划)机器人与具身智能
Physics-IQ固体力学、流体动力学、光学、热力学、磁学物理推理

3.2 五大 Benchmark 的定位关系

1
2
3
4
5
6
7
8
9
10
11
12
13
                    世界模型评测体系
                          │
        ┌─────────────────┼─────────────────┐
        ▼                 ▼                 ▼
    通用能力            领域专用            底层能力
        │                 │                 │
   ┌────┴────┐      ┌─────┴─────┐      ┌────┴────┐
   │         │      │           │      │         │
WorldModel  World  WorldLens  WorldArena  Physics-IQ
  Bench    Score  (自动驾驶)  (具身智能)  (物理推理)
           │
      统一路线横评
      (3D/4D/视频)

这五个 benchmark 并非竞争关系,而是 互补 的:

  • WorldModelBench 是基础入门,判断视频模型是否有世界模型潜力。重点检查牛顿第一定律、形变、流体、穿透、重力等常见”世界建模幻觉”。
  • WorldScore 是横向评测,比较不同技术路线的优劣,将不同技术放在同一基准下进行评测。
  • WorldLens 侧重自动驾驶领域,重点关注几何稳定、物理合理、行为安全,确保自动驾驶场景的安全可靠。
  • WorldArena 侧重具身智能领域,确保世界模型能真正服务机器人。专精与具身智能领域指标评测。
  • Physics-IQ 是通过用真实物理实验视频,评测模型是否真正理解物理规律。

写在最后

世界模型正在经历从”能生成画面”到”理解世界”的范式跃迁。从特斯拉用世界模型生成极端路况训练自动驾驶,到 Physical Intelligence 的 π0.7 让机器人零样本学会叠衣服,再到腾讯 HY-World 2.0 一句话生成可探索的 3D 游戏关卡——这项技术正在从论文走向真实商业场景。

但繁荣之下,一个关键问题浮出水面:我们怎么知道一个世界模型到底好不好?

这正是 WorldScore 要回答的问题。它用 10 个维度、11 个指标,把”世界理解能力”这个模糊概念拆解成了可量化的分数:相机控制测的是”听不听指挥”,3D一致性测的是”穿不穿帮”,运动平滑性测的是”自不自然”。通过统一落盘格式 + 统一调度框架的设计,WorldScore 让 3D 生成、4D 生成、视频生成三条技术路线第一次站在了同一条起跑线上。

展望未来,世界模型评测还有几个值得关注的趋势:

  1. 从静态指标到交互评测:当前 WorldScore 测的还是”生成完再打分”,未来的评测需要评估”实时交互中世界是否保持一致”——你推开一扇门,10分钟后回来,门应该还是开着的
  2. 从视觉到多模态:未来的世界模型不仅要”看起来对”,还要”听起来对”“摸起来对”,评测维度将扩展到音频、触觉
  3. 从通用到垂直:WorldLens 专攻自动驾驶、WorldArena 专攻具身智能、Physics-IQ 专攻物理推理——垂直领域的专用 Benchmark 会越来越多
  4. 从评测到数据引擎:世界模型 + 评测 = 数据飞轮,评测发现弱点 → 针对性生成训练数据 → 模型提升 → 再评测,形成闭环

世界模型的终局,或许不是一个”更大的模型”,而是一个”更懂世界的模型”。而评测,正是丈量”懂不懂世界”的那把尺子。

本文由作者按照 CC BY 4.0 进行授权