跳转到内容

世界模型(World Model)深度研究报告

一、世界模型的学术定义与核心架构

Section titled “一、世界模型的学术定义与核心架构”

世界模型(World Model)是人工智能领域中的一种机器学习系统,其核心特征是构建环境的内部表征(internal representation),并预测环境在响应动作时如何随时间变化。世界模型不仅仅是分类器或生成器——它们模拟物理动力学、物体交互和因果关系,旨在帮助智能体进行规划、推理和行动,而无需不断进行现实世界的试错。

  • 术语起源:Jürgen Schmidhuber 于 1990 年首次在机器学习语境中提出“世界模型”概念,提出用循环神经网络(RNN)从观测中预测未来状态,并用这些预测训练智能体 [Schmidhuber, 1990]。
  • 现代复兴:David Ha 和 Schmidhuber 在 2018 年发表论文“World Models”,让智能体在自生成的模拟环境中学习驾驶虚拟汽车和玩电子游戏 [Ha and Schmidhuber, 2018, arXiv:1803.10122]。

论文来源:LeCun, Y. (2022). “A Path Towards Autonomous Machine Intelligence Version 0.9.2”. OpenReview.

LeCun 在 2022 年发表的位置论文中提出,智能的核心在于对世界的预测性建模,而非纯粹的模式匹配。他提出了 联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA) 作为实现世界模型的实践基础。

JEPA 的核心设计: 1. 编码器(Encoder):将观测(图像、视频等)转换为紧凑的潜在嵌入(latent embedding) 2. 预测器(Predictor):根据当前嵌入和动作,预测未来的嵌入 3. 关键创新:在嵌入空间(embedding space)而非像素空间进行预测,避免逐像素重建的高昂代价 4. 正则化器(Regularizer):保持嵌入的行为良好,防止表征坍缩(representation collapse)

JEPA 的变体演进

变体 年份 输入模态 关键特性
I-JEPA 2023 图像 非生成式自监督学习,在嵌入空间预测图像块 [arXiv:2301.08243]
V-JEPA 2024 视频 视频理解的自监督预训练
V-JEPA 2 2025 视频+动作 达到视频理解和物理推理的SOTA,支持零样本机器人控制 [Meta AI, 2025-06-11]
LeWorldModel 2026 原始像素 端到端稳定训练,仅用两个损失项,避免手工启发式 [arXiv:2603.19312]

LeCun 的核心论点: - LLM 仅在文本上训练,无法预测文本之外的任何现实世界事件 - 智能系统需要“世界模型”来理解和预测物理世界的动态 - JEPA 通过在抽象表示空间中预测,避免了生成模型中“预测每个像素”的不可处理性 - 系统应包含快速反应路径(即时响应)和慢速深思路径(长程规划)

来源:OpenAI (2024). “Video Generation Models as World Simulators”. OpenAI 技术报告.

OpenAI 在 2024 年 2 月发布 Sora 时,将其定位为**“世界模拟器”(world simulator)**,提出了一个重要但存在争议的论点:

核心主张: - 大规模视频生成模型(diffusion transformer 架构)在训练过程中可能涌现出对物理世界的隐式理解 - Sora 能生成包含复杂相机运动、多角色交互、物理效果的长达 60 秒视频 - 通过在时空 patches(spacetime patches)上训练,模型学习了世界的“模拟器”能力

技术架构: - 基于 Diffusion Transformer(DiT) 架构 - 将视频压缩为时空 patches(spacetime latent patches),类似 LLM 中的 token - 使用扩散模型从噪声中逐步去噪生成视频

争议与局限: - Sora 生成的视频经常出现物理违反(物体穿模、因果不一致、重力异常) - 许多研究者认为 Sora 是**“看起来像”世界模型但并非真正理解物理规律**的视频生成器 - LeCun 明确批评:生成每个像素是浪费的,世界模型应在抽象表示空间中预测

论文来源:Bruce et al. (2024). “Genie: Generative Interactive Environments”. [arXiv:2402.15391]

Genie 1(2024年2月): - 首个从无标注互联网视频中无监督训练的生成式交互环境 - 11B 参数,被定位为“基础世界模型”(foundation world model) - 三大组件: 1. 时空视频分词器(Spatiotemporal video tokenizer) 2. 自回归动力学模型(Autoregressive dynamics model) 3. 潜在动作模型(Latent action model)——从视频中自动发现并推断动作空间 - 关键创新:无需任何真实动作标签即可实现逐帧交互控制

Genie 2(2024年底): - 增加了三维生成能力 - 支持更丰富的物理交互和持久性环境

Genie 3(2025年8月): - 生成照片级真实感的实时交互世界 - 24 FPS 实时渲染,支持文本/图像提示生成持久性 3D 世界 - 支持实时交互(键盘/鼠标/文本控制) - Waymo 于 2026 年 2 月采用 Genie 3 构建“Waymo 世界模型”用于自动驾驶模拟——可生成同步的相机和激光雷达输出,创造真实机器人出租车罕见的边缘场景

论文来源:NVIDIA (2025). “Cosmos World Foundation Model Platform for Physical AI”. [arXiv:2501.03575]

Cosmos 1(2025年1月): - 世界基础模型平台(World Foundation Model Platform),旨在帮助开发者构建定制化世界模型 - 核心理念:物理 AI 需要先在数字世界中训练——需要自身的数字孪生(策略模型)和世界的数字孪生(世界模型) - 开源开放权重,采用宽松许可证 - 平台组件: 1. 视频策划管道(Video curation pipeline) 2. 预训练世界基础模型 3. 后训练示例 4. 视频分词器

Cosmos 3(2026年6月): - 首个开源全能模型(Open Omni-model),融合物理推理、世界模拟和动作生成 - Mixture-of-Transformers(MoT)架构: - 自回归 Transformer(AR):处理推理和下一 token 预测 - 扩散 Transformer(DT):处理多模态生成 - 编码器:ViT(视觉)、VAE(视觉/音频)、领域特定编码器(动作) - 使用 3D 多维旋转位置编码(mRoPE)处理空间和时间信息 - 模型规格: - Cosmos3-Nano:16B 参数(工作站级) - Cosmos3-Super:64B 参数(研究级) - 可处理和生成文本、图像、视频、音频、动作序列


二、世界模型与传统 LLM、多模态模型的本质区别

Section titled “二、世界模型与传统 LLM、多模态模型的本质区别”
维度 传统 LLM 多模态模型(如 GPT-4V) 世界模型
输入模态 纯文本 文本+图像/音频等 传感器数据(像素、视频、激光雷达、雷达、音频),文本作为提示
预测目标 下一文本 token 下一文本/图像 token 潜在空间中的状态变化
理解物理 基本无 模拟物理动力学、物体交互、因果关系
因果推理 表面文本关联 表面多模态关联 支持因果规划和推理
时间建模 文本序列 离散帧序列 连续时间动态建模
可交互性 文本对话 文本+图像对话 可执行动作并观测环境响应
长程预测 文本续写 有限 跨时间步的环境状态预测
输出 文本 文本+图像 视频序列、3D场景、激光雷达、控制指令
架构 Transformer(含 MoE 等改进) Transformer+视觉编码器 编码器+预测器+模拟器+可能的评论器

1. 预测空间不同 - LLM 在离散 token 空间预测——本质是统计语言模式匹配 - 世界模型在连续潜在空间预测——学习的是物理世界的状态转移函数 - LeCun 的核心论点:LLM 仅在文本上训练,“无法预测文本以外的任何事物,如现实世界事件”

2. 对因果关系的建模 - LLM 学习的是文本中的统计共现关系,并非因果关系 - 世界模型需要学习行动→状态变化的因果关系,支持反事实推理

3. 与环境的耦合方式 - LLM 是开环系统:输入→输出,无环境反馈 - 世界模型是闭环系统:观测→预测→行动→新观测,与环境持续交互

4. 泛化方向 - LLM 在语言任务上泛化(翻译、摘要、代码) - 世界模型需要在未见过的物理场景上泛化(新的物体配置、新的物理条件)

5. 组合方式 - 实践中两者可组合:LLM 处理高层指令理解,世界模型管理底层物理控制


三、真正的世界模型必须具备的核心能力

Section titled “三、真正的世界模型必须具备的核心能力”

3.1 物理规律理解(Physical Understanding)

Section titled “3.1 物理规律理解(Physical Understanding)”

模型必须理解并预测: - 经典力学:重力、惯性、碰撞、摩擦 - 物体持久性(Object Permanence):被遮挡物体仍然存在 - 刚体与非刚体动力学:固体 vs 流体/柔体的不同行为 - 空间关系:遮挡、包含、相对位置 - 材料属性:玻璃易碎、液体流动

测试基准:IntPhys 2 基准测试物理违反检测——展示成对视频,其中一个违反物理规则。人类接近 100% 准确率,但 V-JEPA 2 在许多条件下仅略好于随机猜测,说明当前模型离真正的物理理解仍有巨大差距。

  • 理解**“如果做A,则B会发生”**的因果链
  • 区分相关性因果性
  • 支持干预推理(interventional reasoning):do(X) → Y 的预测

3.3 长程预测(Long-horizon Prediction)

Section titled “3.3 长程预测(Long-horizon Prediction)”
  • 不仅是下一帧预测,而是多步/多分钟的未来状态预测
  • 保持长程时间一致性(物体不突然消失/变形)
  • 处理复合误差(error compounding):预测误差随时间步累积

3.4 反事实推演(Counterfactual Reasoning)

Section titled “3.4 反事实推演(Counterfactual Reasoning)”
  • “如果当时做了不同的选择,会发生什么?”
  • 在同一初始条件下,评估不同动作序列的后果
  • 这是规划(planning)和决策的核心基础
  • 接受动作输入并产生相应的环境状态变化
  • 支持实时交互(如 Genie 3 的 24 FPS 实时交互)
  • 动作空间的灵活性:从离散动作(键盘控制)到连续控制(机器人关节角度)
  • 将学到的物理规则组合到新场景中
  • 零样本迁移到未见过的环境(如 V-JEPA 2 支持零样本机器人控制)
  • 在不同模态间迁移(从视频学习到机器人执行)
  • 记忆离开屏幕的物体(off-screen object memory)
  • 维护环境的持久状态,而非每帧独立生成
  • Genie 3 的交互评估明确测试了这一能力

四、业界公认的“达标门槛”与基准测试

Section titled “四、业界公认的“达标门槛”与基准测试”
基准测试 提出者 测试维度 当前状态
IntPhys 2 Meta/Bordes et al. [arXiv:2506.09849] 物理违反检测(直观物理理解) 人类~100%;V-JEPA 2 多数条件仅略好于随机
MVPBench (Minimal Video Pairs) Meta/Krojer [arXiv:2506.09987] 通过短视频多选题测试物理理解和因果关系 专门设计防止“捷径”推理
Something-Something Goyal et al. [arXiv:1706.04261] 动作识别和视觉常识 经典基准
Epic-Kitchens-100 EPIC 系列 人类动作预期(Recall@5) 真实场景动作预测
Ego4D Meta 第一人称视角视频理解 大规模 egocentric 基准
Genie 3 交互评估 DeepMind 分钟级交互一致性、离屏物体记忆、用户动作/文本响应 实时交互式评估
Waymo 世界模型基准 Waymo 生成质量(真实感、可控性、训练规划器的有用性) 自动驾驶专用

尽管目前没有统一的“世界模型认证标准”,但业界形成了若干共识性的门槛:

第一层:视频生成一致性(当前多数模型) - 能生成时间一致、物理合理的视频片段 - 局限:本质上仍是模式匹配,非真正物理理解

第二层:交互可控性(Genie 3、Sora 等接近) - 用户可通过动作/文本控制生成内容 - 生成内容响应交互指令

第三层:物理推理达标(当前尚未实现) - 在 IntPhys 2 上接近人类水平(~100%) - 这是当前最严格的门槛——V-JEPA 2 作为最先进的模型之一,在多数条件下仍仅略好于随机

第四层:零样本真实世界迁移(终极目标) - 在模拟中学到的能力可零样本迁移到真实机器人/车辆 - V-JEPA 2 展示了初步的零样本机器人控制能力,但远未成熟

第五层:长程规划与反事实推理(远期目标) - 在复杂环境中进行多步规划 - 评估不同行动方案后果并选择最优

  • 像素重建误差 vs 真实性能脱钩:视频预测准确率或机器人成功率并不总是预测真实世界表现
  • “捷径”问题:模型可能利用表面线索而非真正理解物理来通过测试(MVPBench 专门设计来防止此问题)
  • 评估时间尺度:短期一致性容易,分钟级一致性极难

五、从当前 LLM 到世界模型的技术路线图与阶段划分

Section titled “五、从当前 LLM 到世界模型的技术路线图与阶段划分”

阶段 0-1:语言与感知(已完成) - LLM 掌握语言理解与生成 - 多模态扩展实现图像/音频理解 - 局限:无物理理解,无因果推理,无环境交互

阶段 2:视频生成作为世界模拟(2024,当前进行中) - Sora 提出“视频生成模型作为世界模拟器”的范式 - 关键技术:Diffusion Transformer、时空 patches - 局限:物理违反频发,无真正交互,本质是像素级生成 - 争议:这是否算“世界模型”存在根本分歧

阶段 3:交互式世界生成(2024-2025) - Genie 系列实现从视频中无监督学习交互环境 - 关键技术:潜在动作模型、自回归动力学 - 突破:无需动作标签的交互控制 - 局限:物理一致性有限,难以处理复杂场景

阶段 4:物理推理与世界基础模型(2025-2026,当前前沿) - V-JEPA 2 在嵌入空间进行物理预测 - Cosmos 提供开源世界基础模型平台 - 关键技术:JEPA 架构、自监督学习、多模态融合 - 突破:零样本机器人控制初步实现 - 局限:IntPhys 2 上远低于人类水平,物理理解不完整

阶段 5-6:通用世界模型与自主智能(未来目标) - 实现人类级物理直觉 - 长程规划与反事实推理 - 真实世界零样本迁移 - LeCun 2026 年创立 AMI Labs 推进此目标

当前存在两条主要技术路线

路线 A:生成式路线(OpenAI Sora, Google Genie) - 基于扩散模型/自回归模型直接生成视频/场景 - 优势:视觉效果好,可生成新颖内容 - 劣势:计算成本高,物理一致性难以保证,像素级生成浪费计算

路线 B:预测式路线(LeCun JEPA, V-JEPA 2) - 在潜在嵌入空间预测未来状态 - 优势:计算高效,专注抽象预测,避免无关细节 - 劣势:不直接生成可观测输出,需要额外解码器,表征坍缩问题

融合趋势:Cosmos 3 的 MoT 架构尝试融合两条路线——AR 处理推理,DT 处理生成,共享表示空间。


六、当前主要玩家的世界模型进展

Section titled “六、当前主要玩家的世界模型进展”
项目 时间 定位 关键特性 局限
Sora 2024.02 “世界模拟器” DiT架构,时空patches,60秒视频生成 物理违反频发,争议大
Sora 2 2025 升级版世界模拟器 改进物理一致性 仍非真正交互式世界模型

OpenAI 的立场:将视频生成模型定位为隐式世界模拟器,认为规模扩大可涌现物理理解。这一立场受到 LeCun 等人的强烈质疑。

项目 时间 参数规模 关键特性
Genie 1 2024.02 11B 无标注视频学习,潜在动作模型,基础世界模型
Genie 2 2024末 未公开 3D生成,更丰富物理交互
Genie 3 2025.08 未公开 照片级真实感,24FPS实时交互,持久3D世界
Waymo世界模型 2026.02 未公开 自动驾驶专用,同步相机+激光雷达,边缘场景生成

Google 的优势:从研究到产品落地的完整链路(Genie → Waymo 实际应用),在交互式世界生成方面领先。

项目 时间 关键特性
I-JEPA 2023 图像自监督,嵌入空间预测 [arXiv:2301.08243]
V-JEPA 2024 视频自监督预训练
V-JEPA 2 2025.06 SOTA视频理解+物理推理,零样本机器人控制
LeWorldModel 2026.03 端到端从像素训练,两损失项,无手工启发式 [arXiv:2603.19312]
AMI Labs 2026.03 LeCun离开Meta创立,融资10.3亿美元,专注世界模型

Meta/LeCun 的路线:坚持 JEPA 架构,在潜在空间预测而非像素生成。V-JEPA 2 提出了 IntPhys 2、MVPBench、Something-Something 三个基准,但结果暴露了当前模型离真正物理理解仍有巨大差距。

项目 时间 关键特性
Cosmos 1 2025.01 开源世界基础模型平台,视频策划+预训练+后训练+分词器 [arXiv:2501.03575]
Cosmos 3 2026.06 开源全能模型,MoT架构(AR+DT),多模态(文本/图像/视频/音频/动作),mRoPE

NVIDIA 的定位:基础设施提供者——开源开放权重,为 Physical AI 开发者提供平台。Cosmos 3 的 16B/64B 参数模型覆盖从工作站到研究级需求。

技术特点: - Mixture-of-Transformers:AR 处理推理 + DT 处理生成 - 统一表示空间:ViT/VAE/领域编码器 → 共享嵌入空间 - 3D mRoPE:同时编码空间和时间信息

公司/团队 项目 亮点
World Labs(李飞飞) Spark 2.0 (2026.04) 开源3D高斯溅射渲染引擎,面向智能手机级设备;融资10亿美元
阿里巴巴 Happy Oyster (2026.04) 实时“流畅”世界模型,导演模式(世界构建)+漫游模式(世界探索),3分钟视频片段
General Intuition 种子轮融资1.337亿美元
Waymo Waymo世界模型 基于Genie 3,自动驾驶专用,同步多传感器输出
维度 OpenAI Google Meta/LeCun NVIDIA
核心架构 Diffusion Transformer 自回归+潜在动作 JEPA(嵌入预测) MoT(AR+DT融合)
预测空间 像素/时空patches 潜在token+像素 潜在嵌入空间 共享表示空间
开源程度 闭源 闭源(论文公开) 部分开源(模型权重) 开源开放权重
交互性 有限 强(Genie 3实时交互) 弱(侧重理解) 中等(平台化)
物理推理 隐式(争议中) 中等 显式但有限 融合式
落地场景 创意/视频 游戏/自动驾驶 机器人/研究 Physical AI平台
核心争议 “是否真是世界模型” “IntPhys 2表现差”

世界模型领域正处于阶段 3-4 的过渡期: - 交互式世界生成已初步实现(Genie 3) - 物理推理世界模型正在发展(V-JEPA 2, Cosmos 3) - 但距离真正的物理理解(IntPhys 2 人类水平)仍有巨大差距 - 零样本真实世界迁移仅展示初步可能

  1. 物理理解的根本性突破:当前最好的模型在 IntPhys 2 上多数条件仅略好于随机——这表明统计学习范式可能不足以实现真正的物理直觉
  2. 长程一致性:分钟级时间一致性极难实现,误差累积问题严重
  3. 计算效率:像素级生成(Sora路线)计算成本极高;嵌入空间预测(JEPA路线)更高效但难以直接输出
  4. 评估方法:像素重建误差与真实性能脱钩,需要更好的评估范式
  5. 安全与对齐:强大的世界模型可用于模拟危险场景,需要安全框架
  1. 架构融合:Cosmos 3 的 MoT 架构代表生成式与预测式路线的融合趋势
  2. 开源化:NVIDIA Cosmos 系列推动开源世界模型生态
  3. 产业化落地:Waymo 使用 Genie 3 进行自动驾驶模拟,标志着从研究到产品的跨越
  4. 资本涌入:AMI Labs(10.3亿美元)、World Labs(10亿美元)等大量融资
  5. 基准驱动:IntPhys 2 等严格基准揭示了当前模型的真实水平,防止过度宣传
  1. Schmidhuber, J. (1990). “Planning and Reinforcement Learning with Recurrent World Models and Artificial Curiosity”
  2. Ha, D. and Schmidhuber, J. (2018). “World Models”. [arXiv:1803.10122]
  3. LeCun, Y. (2022). “A Path Towards Autonomous Machine Intelligence Version 0.9.2”. OpenReview.
  4. Assran et al. (2023). “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture”. [arXiv:2301.08243]
  5. OpenAI (2024). “Video Generation Models as World Simulators”. 技术报告.
  6. Bruce et al. (2024). “Genie: Generative Interactive Environments”. [arXiv:2402.15391]
  7. NVIDIA (2025). “Cosmos World Foundation Model Platform for Physical AI”. [arXiv:2501.03575]
  8. Meta AI (2025). “Introducing the V-JEPA 2 world model and new benchmarks for physical reasoning”. 2025-06-11.
  9. Bordes et al. (2025). “IntPhys 2: Benchmarking Intuitive Physics Understanding”. [arXiv:2506.09849]
  10. Krojer, B. (2025). “A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs”. [arXiv:2506.09987]
  11. Maes et al. (2026). “LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels”. [arXiv:2603.19312]
  12. NVIDIA (2026). “Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action”. HuggingFace.
  13. DeepMind (2025). “Genie 3: A new frontier for world models”. 2025-08-05.
  14. Wikipedia: “World model (artificial intelligence)”. 最后编辑 2026-06-03.