世界模型(World Model)深度研究报告
一、世界模型的学术定义与核心架构
Section titled “一、世界模型的学术定义与核心架构”1.1 基本定义
Section titled “1.1 基本定义”世界模型(World Model)是人工智能领域中的一种机器学习系统,其核心特征是构建环境的内部表征(internal representation),并预测环境在响应动作时如何随时间变化。世界模型不仅仅是分类器或生成器——它们模拟物理动力学、物体交互和因果关系,旨在帮助智能体进行规划、推理和行动,而无需不断进行现实世界的试错。
- 术语起源:Jürgen Schmidhuber 于 1990 年首次在机器学习语境中提出“世界模型”概念,提出用循环神经网络(RNN)从观测中预测未来状态,并用这些预测训练智能体 [Schmidhuber, 1990]。
- 现代复兴:David Ha 和 Schmidhuber 在 2018 年发表论文“World Models”,让智能体在自生成的模拟环境中学习驾驶虚拟汽车和玩电子游戏 [Ha and Schmidhuber, 2018, arXiv:1803.10122]。
1.2 Yann LeCun 的 JEPA 架构
Section titled “1.2 Yann LeCun 的 JEPA 架构”论文来源:LeCun, Y. (2022). “A Path Towards Autonomous Machine Intelligence Version 0.9.2”. OpenReview.
LeCun 在 2022 年发表的位置论文中提出,智能的核心在于对世界的预测性建模,而非纯粹的模式匹配。他提出了 联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA) 作为实现世界模型的实践基础。
JEPA 的核心设计: 1. 编码器(Encoder):将观测(图像、视频等)转换为紧凑的潜在嵌入(latent embedding) 2. 预测器(Predictor):根据当前嵌入和动作,预测未来的嵌入 3. 关键创新:在嵌入空间(embedding space)而非像素空间进行预测,避免逐像素重建的高昂代价 4. 正则化器(Regularizer):保持嵌入的行为良好,防止表征坍缩(representation collapse)
JEPA 的变体演进:
| 变体 | 年份 | 输入模态 | 关键特性 |
|---|---|---|---|
| I-JEPA | 2023 | 图像 | 非生成式自监督学习,在嵌入空间预测图像块 [arXiv:2301.08243] |
| V-JEPA | 2024 | 视频 | 视频理解的自监督预训练 |
| V-JEPA 2 | 2025 | 视频+动作 | 达到视频理解和物理推理的SOTA,支持零样本机器人控制 [Meta AI, 2025-06-11] |
| LeWorldModel | 2026 | 原始像素 | 端到端稳定训练,仅用两个损失项,避免手工启发式 [arXiv:2603.19312] |
LeCun 的核心论点: - LLM 仅在文本上训练,无法预测文本之外的任何现实世界事件 - 智能系统需要“世界模型”来理解和预测物理世界的动态 - JEPA 通过在抽象表示空间中预测,避免了生成模型中“预测每个像素”的不可处理性 - 系统应包含快速反应路径(即时响应)和慢速深思路径(长程规划)
1.3 Sora 的“世界模拟器”概念
Section titled “1.3 Sora 的“世界模拟器”概念”来源:OpenAI (2024). “Video Generation Models as World Simulators”. OpenAI 技术报告.
OpenAI 在 2024 年 2 月发布 Sora 时,将其定位为**“世界模拟器”(world simulator)**,提出了一个重要但存在争议的论点:
核心主张: - 大规模视频生成模型(diffusion transformer 架构)在训练过程中可能涌现出对物理世界的隐式理解 - Sora 能生成包含复杂相机运动、多角色交互、物理效果的长达 60 秒视频 - 通过在时空 patches(spacetime patches)上训练,模型学习了世界的“模拟器”能力
技术架构: - 基于 Diffusion Transformer(DiT) 架构 - 将视频压缩为时空 patches(spacetime latent patches),类似 LLM 中的 token - 使用扩散模型从噪声中逐步去噪生成视频
争议与局限: - Sora 生成的视频经常出现物理违反(物体穿模、因果不一致、重力异常) - 许多研究者认为 Sora 是**“看起来像”世界模型但并非真正理解物理规律**的视频生成器 - LeCun 明确批评:生成每个像素是浪费的,世界模型应在抽象表示空间中预测
1.4 Google DeepMind Genie
Section titled “1.4 Google DeepMind Genie”论文来源:Bruce et al. (2024). “Genie: Generative Interactive Environments”. [arXiv:2402.15391]
Genie 1(2024年2月): - 首个从无标注互联网视频中无监督训练的生成式交互环境 - 11B 参数,被定位为“基础世界模型”(foundation world model) - 三大组件: 1. 时空视频分词器(Spatiotemporal video tokenizer) 2. 自回归动力学模型(Autoregressive dynamics model) 3. 潜在动作模型(Latent action model)——从视频中自动发现并推断动作空间 - 关键创新:无需任何真实动作标签即可实现逐帧交互控制
Genie 2(2024年底): - 增加了三维生成能力 - 支持更丰富的物理交互和持久性环境
Genie 3(2025年8月): - 生成照片级真实感的实时交互世界 - 24 FPS 实时渲染,支持文本/图像提示生成持久性 3D 世界 - 支持实时交互(键盘/鼠标/文本控制) - Waymo 于 2026 年 2 月采用 Genie 3 构建“Waymo 世界模型”用于自动驾驶模拟——可生成同步的相机和激光雷达输出,创造真实机器人出租车罕见的边缘场景
1.5 NVIDIA Cosmos
Section titled “1.5 NVIDIA Cosmos”论文来源:NVIDIA (2025). “Cosmos World Foundation Model Platform for Physical AI”. [arXiv:2501.03575]
Cosmos 1(2025年1月): - 世界基础模型平台(World Foundation Model Platform),旨在帮助开发者构建定制化世界模型 - 核心理念:物理 AI 需要先在数字世界中训练——需要自身的数字孪生(策略模型)和世界的数字孪生(世界模型) - 开源开放权重,采用宽松许可证 - 平台组件: 1. 视频策划管道(Video curation pipeline) 2. 预训练世界基础模型 3. 后训练示例 4. 视频分词器
Cosmos 3(2026年6月): - 首个开源全能模型(Open Omni-model),融合物理推理、世界模拟和动作生成 - Mixture-of-Transformers(MoT)架构: - 自回归 Transformer(AR):处理推理和下一 token 预测 - 扩散 Transformer(DT):处理多模态生成 - 编码器:ViT(视觉)、VAE(视觉/音频)、领域特定编码器(动作) - 使用 3D 多维旋转位置编码(mRoPE)处理空间和时间信息 - 模型规格: - Cosmos3-Nano:16B 参数(工作站级) - Cosmos3-Super:64B 参数(研究级) - 可处理和生成文本、图像、视频、音频、动作序列
二、世界模型与传统 LLM、多模态模型的本质区别
Section titled “二、世界模型与传统 LLM、多模态模型的本质区别”2.1 核心对比表
Section titled “2.1 核心对比表”| 维度 | 传统 LLM | 多模态模型(如 GPT-4V) | 世界模型 |
|---|---|---|---|
| 输入模态 | 纯文本 | 文本+图像/音频等 | 传感器数据(像素、视频、激光雷达、雷达、音频),文本作为提示 |
| 预测目标 | 下一文本 token | 下一文本/图像 token | 潜在空间中的状态变化 |
| 理解物理 | 无 | 基本无 | 模拟物理动力学、物体交互、因果关系 |
| 因果推理 | 表面文本关联 | 表面多模态关联 | 支持因果规划和推理 |
| 时间建模 | 文本序列 | 离散帧序列 | 连续时间动态建模 |
| 可交互性 | 文本对话 | 文本+图像对话 | 可执行动作并观测环境响应 |
| 长程预测 | 文本续写 | 有限 | 跨时间步的环境状态预测 |
| 输出 | 文本 | 文本+图像 | 视频序列、3D场景、激光雷达、控制指令 |
| 架构 | Transformer(含 MoE 等改进) | Transformer+视觉编码器 | 编码器+预测器+模拟器+可能的评论器 |
2.2 本质区别的深层分析
Section titled “2.2 本质区别的深层分析”1. 预测空间不同 - LLM 在离散 token 空间预测——本质是统计语言模式匹配 - 世界模型在连续潜在空间预测——学习的是物理世界的状态转移函数 - LeCun 的核心论点:LLM 仅在文本上训练,“无法预测文本以外的任何事物,如现实世界事件”
2. 对因果关系的建模 - LLM 学习的是文本中的统计共现关系,并非因果关系 - 世界模型需要学习行动→状态变化的因果关系,支持反事实推理
3. 与环境的耦合方式 - LLM 是开环系统:输入→输出,无环境反馈 - 世界模型是闭环系统:观测→预测→行动→新观测,与环境持续交互
4. 泛化方向 - LLM 在语言任务上泛化(翻译、摘要、代码) - 世界模型需要在未见过的物理场景上泛化(新的物体配置、新的物理条件)
5. 组合方式 - 实践中两者可组合:LLM 处理高层指令理解,世界模型管理底层物理控制
三、真正的世界模型必须具备的核心能力
Section titled “三、真正的世界模型必须具备的核心能力”3.1 物理规律理解(Physical Understanding)
Section titled “3.1 物理规律理解(Physical Understanding)”模型必须理解并预测: - 经典力学:重力、惯性、碰撞、摩擦 - 物体持久性(Object Permanence):被遮挡物体仍然存在 - 刚体与非刚体动力学:固体 vs 流体/柔体的不同行为 - 空间关系:遮挡、包含、相对位置 - 材料属性:玻璃易碎、液体流动
测试基准:IntPhys 2 基准测试物理违反检测——展示成对视频,其中一个违反物理规则。人类接近 100% 准确率,但 V-JEPA 2 在许多条件下仅略好于随机猜测,说明当前模型离真正的物理理解仍有巨大差距。
3.2 因果推理(Causal Reasoning)
Section titled “3.2 因果推理(Causal Reasoning)”- 理解**“如果做A,则B会发生”**的因果链
- 区分相关性和因果性
- 支持干预推理(interventional reasoning):do(X) → Y 的预测
3.3 长程预测(Long-horizon Prediction)
Section titled “3.3 长程预测(Long-horizon Prediction)”- 不仅是下一帧预测,而是多步/多分钟的未来状态预测
- 保持长程时间一致性(物体不突然消失/变形)
- 处理复合误差(error compounding):预测误差随时间步累积
3.4 反事实推演(Counterfactual Reasoning)
Section titled “3.4 反事实推演(Counterfactual Reasoning)”- “如果当时做了不同的选择,会发生什么?”
- 在同一初始条件下,评估不同动作序列的后果
- 这是规划(planning)和决策的核心基础
3.5 可交互性(Interactivity)
Section titled “3.5 可交互性(Interactivity)”- 接受动作输入并产生相应的环境状态变化
- 支持实时交互(如 Genie 3 的 24 FPS 实时交互)
- 动作空间的灵活性:从离散动作(键盘控制)到连续控制(机器人关节角度)
3.6 可组合性与泛化性
Section titled “3.6 可组合性与泛化性”- 将学到的物理规则组合到新场景中
- 零样本迁移到未见过的环境(如 V-JEPA 2 支持零样本机器人控制)
- 在不同模态间迁移(从视频学习到机器人执行)
3.7 持久性与记忆
Section titled “3.7 持久性与记忆”- 记忆离开屏幕的物体(off-screen object memory)
- 维护环境的持久状态,而非每帧独立生成
- Genie 3 的交互评估明确测试了这一能力
四、业界公认的“达标门槛”与基准测试
Section titled “四、业界公认的“达标门槛”与基准测试”4.1 主要基准测试
Section titled “4.1 主要基准测试”| 基准测试 | 提出者 | 测试维度 | 当前状态 |
|---|---|---|---|
| IntPhys 2 | Meta/Bordes et al. [arXiv:2506.09849] | 物理违反检测(直观物理理解) | 人类~100%;V-JEPA 2 多数条件仅略好于随机 |
| MVPBench (Minimal Video Pairs) | Meta/Krojer [arXiv:2506.09987] | 通过短视频多选题测试物理理解和因果关系 | 专门设计防止“捷径”推理 |
| Something-Something | Goyal et al. [arXiv:1706.04261] | 动作识别和视觉常识 | 经典基准 |
| Epic-Kitchens-100 | EPIC 系列 | 人类动作预期(Recall@5) | 真实场景动作预测 |
| Ego4D | Meta | 第一人称视角视频理解 | 大规模 egocentric 基准 |
| Genie 3 交互评估 | DeepMind | 分钟级交互一致性、离屏物体记忆、用户动作/文本响应 | 实时交互式评估 |
| Waymo 世界模型基准 | Waymo | 生成质量(真实感、可控性、训练规划器的有用性) | 自动驾驶专用 |
4.2 “达标门槛”的业界共识
Section titled “4.2 “达标门槛”的业界共识”尽管目前没有统一的“世界模型认证标准”,但业界形成了若干共识性的门槛:
第一层:视频生成一致性(当前多数模型) - 能生成时间一致、物理合理的视频片段 - 局限:本质上仍是模式匹配,非真正物理理解
第二层:交互可控性(Genie 3、Sora 等接近) - 用户可通过动作/文本控制生成内容 - 生成内容响应交互指令
第三层:物理推理达标(当前尚未实现) - 在 IntPhys 2 上接近人类水平(~100%) - 这是当前最严格的门槛——V-JEPA 2 作为最先进的模型之一,在多数条件下仍仅略好于随机
第四层:零样本真实世界迁移(终极目标) - 在模拟中学到的能力可零样本迁移到真实机器人/车辆 - V-JEPA 2 展示了初步的零样本机器人控制能力,但远未成熟
第五层:长程规划与反事实推理(远期目标) - 在复杂环境中进行多步规划 - 评估不同行动方案后果并选择最优
4.3 关键评估挑战
Section titled “4.3 关键评估挑战”- 像素重建误差 vs 真实性能脱钩:视频预测准确率或机器人成功率并不总是预测真实世界表现
- “捷径”问题:模型可能利用表面线索而非真正理解物理来通过测试(MVPBench 专门设计来防止此问题)
- 评估时间尺度:短期一致性容易,分钟级一致性极难
五、从当前 LLM 到世界模型的技术路线图与阶段划分
Section titled “五、从当前 LLM 到世界模型的技术路线图与阶段划分”5.1 技术路线图
Section titled “5.1 技术路线图”5.2 各阶段详细说明
Section titled “5.2 各阶段详细说明”阶段 0-1:语言与感知(已完成) - LLM 掌握语言理解与生成 - 多模态扩展实现图像/音频理解 - 局限:无物理理解,无因果推理,无环境交互
阶段 2:视频生成作为世界模拟(2024,当前进行中) - Sora 提出“视频生成模型作为世界模拟器”的范式 - 关键技术:Diffusion Transformer、时空 patches - 局限:物理违反频发,无真正交互,本质是像素级生成 - 争议:这是否算“世界模型”存在根本分歧
阶段 3:交互式世界生成(2024-2025) - Genie 系列实现从视频中无监督学习交互环境 - 关键技术:潜在动作模型、自回归动力学 - 突破:无需动作标签的交互控制 - 局限:物理一致性有限,难以处理复杂场景
阶段 4:物理推理与世界基础模型(2025-2026,当前前沿) - V-JEPA 2 在嵌入空间进行物理预测 - Cosmos 提供开源世界基础模型平台 - 关键技术:JEPA 架构、自监督学习、多模态融合 - 突破:零样本机器人控制初步实现 - 局限:IntPhys 2 上远低于人类水平,物理理解不完整
阶段 5-6:通用世界模型与自主智能(未来目标) - 实现人类级物理直觉 - 长程规划与反事实推理 - 真实世界零样本迁移 - LeCun 2026 年创立 AMI Labs 推进此目标
5.3 关键技术分叉
Section titled “5.3 关键技术分叉”当前存在两条主要技术路线:
路线 A:生成式路线(OpenAI Sora, Google Genie) - 基于扩散模型/自回归模型直接生成视频/场景 - 优势:视觉效果好,可生成新颖内容 - 劣势:计算成本高,物理一致性难以保证,像素级生成浪费计算
路线 B:预测式路线(LeCun JEPA, V-JEPA 2) - 在潜在嵌入空间预测未来状态 - 优势:计算高效,专注抽象预测,避免无关细节 - 劣势:不直接生成可观测输出,需要额外解码器,表征坍缩问题
融合趋势:Cosmos 3 的 MoT 架构尝试融合两条路线——AR 处理推理,DT 处理生成,共享表示空间。
六、当前主要玩家的世界模型进展
Section titled “六、当前主要玩家的世界模型进展”6.1 OpenAI
Section titled “6.1 OpenAI”| 项目 | 时间 | 定位 | 关键特性 | 局限 |
|---|---|---|---|---|
| Sora | 2024.02 | “世界模拟器” | DiT架构,时空patches,60秒视频生成 | 物理违反频发,争议大 |
| Sora 2 | 2025 | 升级版世界模拟器 | 改进物理一致性 | 仍非真正交互式世界模型 |
OpenAI 的立场:将视频生成模型定位为隐式世界模拟器,认为规模扩大可涌现物理理解。这一立场受到 LeCun 等人的强烈质疑。
6.2 Google DeepMind
Section titled “6.2 Google DeepMind”| 项目 | 时间 | 参数规模 | 关键特性 |
|---|---|---|---|
| Genie 1 | 2024.02 | 11B | 无标注视频学习,潜在动作模型,基础世界模型 |
| Genie 2 | 2024末 | 未公开 | 3D生成,更丰富物理交互 |
| Genie 3 | 2025.08 | 未公开 | 照片级真实感,24FPS实时交互,持久3D世界 |
| Waymo世界模型 | 2026.02 | 未公开 | 自动驾驶专用,同步相机+激光雷达,边缘场景生成 |
Google 的优势:从研究到产品落地的完整链路(Genie → Waymo 实际应用),在交互式世界生成方面领先。
6.3 Meta / Yann LeCun
Section titled “6.3 Meta / Yann LeCun”| 项目 | 时间 | 关键特性 |
|---|---|---|
| I-JEPA | 2023 | 图像自监督,嵌入空间预测 [arXiv:2301.08243] |
| V-JEPA | 2024 | 视频自监督预训练 |
| V-JEPA 2 | 2025.06 | SOTA视频理解+物理推理,零样本机器人控制 |
| LeWorldModel | 2026.03 | 端到端从像素训练,两损失项,无手工启发式 [arXiv:2603.19312] |
| AMI Labs | 2026.03 | LeCun离开Meta创立,融资10.3亿美元,专注世界模型 |
Meta/LeCun 的路线:坚持 JEPA 架构,在潜在空间预测而非像素生成。V-JEPA 2 提出了 IntPhys 2、MVPBench、Something-Something 三个基准,但结果暴露了当前模型离真正物理理解仍有巨大差距。
6.4 NVIDIA
Section titled “6.4 NVIDIA”| 项目 | 时间 | 关键特性 |
|---|---|---|
| Cosmos 1 | 2025.01 | 开源世界基础模型平台,视频策划+预训练+后训练+分词器 [arXiv:2501.03575] |
| Cosmos 3 | 2026.06 | 开源全能模型,MoT架构(AR+DT),多模态(文本/图像/视频/音频/动作),mRoPE |
NVIDIA 的定位:基础设施提供者——开源开放权重,为 Physical AI 开发者提供平台。Cosmos 3 的 16B/64B 参数模型覆盖从工作站到研究级需求。
技术特点: - Mixture-of-Transformers:AR 处理推理 + DT 处理生成 - 统一表示空间:ViT/VAE/领域编码器 → 共享嵌入空间 - 3D mRoPE:同时编码空间和时间信息
6.5 其他重要玩家
Section titled “6.5 其他重要玩家”| 公司/团队 | 项目 | 亮点 |
|---|---|---|
| World Labs(李飞飞) | Spark 2.0 (2026.04) | 开源3D高斯溅射渲染引擎,面向智能手机级设备;融资10亿美元 |
| 阿里巴巴 | Happy Oyster (2026.04) | 实时“流畅”世界模型,导演模式(世界构建)+漫游模式(世界探索),3分钟视频片段 |
| General Intuition | — | 种子轮融资1.337亿美元 |
| Waymo | Waymo世界模型 | 基于Genie 3,自动驾驶专用,同步多传感器输出 |
6.6 各玩家技术路线对比
Section titled “6.6 各玩家技术路线对比”| 维度 | OpenAI | Meta/LeCun | NVIDIA | |
|---|---|---|---|---|
| 核心架构 | Diffusion Transformer | 自回归+潜在动作 | JEPA(嵌入预测) | MoT(AR+DT融合) |
| 预测空间 | 像素/时空patches | 潜在token+像素 | 潜在嵌入空间 | 共享表示空间 |
| 开源程度 | 闭源 | 闭源(论文公开) | 部分开源(模型权重) | 开源开放权重 |
| 交互性 | 有限 | 强(Genie 3实时交互) | 弱(侧重理解) | 中等(平台化) |
| 物理推理 | 隐式(争议中) | 中等 | 显式但有限 | 融合式 |
| 落地场景 | 创意/视频 | 游戏/自动驾驶 | 机器人/研究 | Physical AI平台 |
| 核心争议 | “是否真是世界模型” | — | “IntPhys 2表现差” | — |
七、总结与展望
Section titled “七、总结与展望”7.1 当前状态评估(2026年中)
Section titled “7.1 当前状态评估(2026年中)”世界模型领域正处于阶段 3-4 的过渡期: - 交互式世界生成已初步实现(Genie 3) - 物理推理世界模型正在发展(V-JEPA 2, Cosmos 3) - 但距离真正的物理理解(IntPhys 2 人类水平)仍有巨大差距 - 零样本真实世界迁移仅展示初步可能
7.2 核心技术挑战
Section titled “7.2 核心技术挑战”- 物理理解的根本性突破:当前最好的模型在 IntPhys 2 上多数条件仅略好于随机——这表明统计学习范式可能不足以实现真正的物理直觉
- 长程一致性:分钟级时间一致性极难实现,误差累积问题严重
- 计算效率:像素级生成(Sora路线)计算成本极高;嵌入空间预测(JEPA路线)更高效但难以直接输出
- 评估方法:像素重建误差与真实性能脱钩,需要更好的评估范式
- 安全与对齐:强大的世界模型可用于模拟危险场景,需要安全框架
7.3 关键趋势
Section titled “7.3 关键趋势”- 架构融合:Cosmos 3 的 MoT 架构代表生成式与预测式路线的融合趋势
- 开源化:NVIDIA Cosmos 系列推动开源世界模型生态
- 产业化落地:Waymo 使用 Genie 3 进行自动驾驶模拟,标志着从研究到产品的跨越
- 资本涌入:AMI Labs(10.3亿美元)、World Labs(10亿美元)等大量融资
- 基准驱动:IntPhys 2 等严格基准揭示了当前模型的真实水平,防止过度宣传
7.4 引用来源汇总
Section titled “7.4 引用来源汇总”- Schmidhuber, J. (1990). “Planning and Reinforcement Learning with Recurrent World Models and Artificial Curiosity”
- Ha, D. and Schmidhuber, J. (2018). “World Models”. [arXiv:1803.10122]
- LeCun, Y. (2022). “A Path Towards Autonomous Machine Intelligence Version 0.9.2”. OpenReview.
- Assran et al. (2023). “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture”. [arXiv:2301.08243]
- OpenAI (2024). “Video Generation Models as World Simulators”. 技术报告.
- Bruce et al. (2024). “Genie: Generative Interactive Environments”. [arXiv:2402.15391]
- NVIDIA (2025). “Cosmos World Foundation Model Platform for Physical AI”. [arXiv:2501.03575]
- Meta AI (2025). “Introducing the V-JEPA 2 world model and new benchmarks for physical reasoning”. 2025-06-11.
- Bordes et al. (2025). “IntPhys 2: Benchmarking Intuitive Physics Understanding”. [arXiv:2506.09849]
- Krojer, B. (2025). “A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs”. [arXiv:2506.09987]
- Maes et al. (2026). “LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels”. [arXiv:2603.19312]
- NVIDIA (2026). “Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action”. HuggingFace.
- DeepMind (2025). “Genie 3: A new frontier for world models”. 2025-08-05.
- Wikipedia: “World model (artificial intelligence)”. 最后编辑 2026-06-03.