当大模型还在"读文字",世界模型已经开始"懂世界"。 一文讲清:它到底是什么、底层怎么工作、哪些路线在赛跑、谁在卡位、离我们还有多远。

引子:为什么 2026 被称为"世界模型爆发元年"

过去几年,AI 的高光几乎都属于大语言模型(LLM)——它们能写诗、能编程、能聊天,但只要你问一个最朴素的物理问题:"把一杯水推到桌边,松手会发生什么?"它答得对,靠的不是"理解",而是训练语料里这句话出现过太多次。

这种"懂文字、不懂世界"的割裂,正是 AI 走向真实物理世界的最大瓶颈。

而 2026 年,一股新范式正在快速合流:世界模型(World Model)。NVIDIA、Google DeepMind、Meta、OpenAI、李飞飞的 World Labs,以及腾讯、阿里、蔚来、小鹏、Momenta 等中国玩家,全部下场。

一个被广泛引用的判断是:

大语言模型是 AI 的大脑,世界模型是 AI 的躯体。 未来真正能"干活"的智能体,一定是"LLM 语义大脑 + 世界模型物理躯体"的融合架构。

本文基于公开论文、厂商官方博客与第三方行业研究,带你把这件事一次看懂。

一、世界模型到底是什么?

1. 一句话定义

英伟达对"世界模型"的官方定义非常直白:它是一个理解物理世界如何运转的 AI 模型——重力、惯性、碰撞动力学

用数学语言表达,它的本质是一个状态转移函数

s{t+1} = W_θ( s_t , a_t )

也就是:给定"当前状态 + 你采取的行动",模型预测"世界的下一个状态"。

它背后是部分可观测马尔可夫决策过程(POMDP)——智能体永远无法直接看到世界全貌,只能通过传感器获得"观测",再据此决策。

2. 与 LLM 的本质区别

维度

大语言模型 LLM

世界模型 World Model

预测对象

下一个 Token(文本序列概率)

下一个环境状态(物理动态演化)

知识来源

海量文本,学的是"结论"

视觉/点云/传感/视频,学的是"规律"

角色定位

认知旁观者、思维决策者

环境参与者、实操执行者

核心短板

无物理体感,存在大量常识幻觉

抽象语义/逻辑推理相对薄弱

一句话总结:LLM 负责"思考和表达",世界模型负责"感知和动手"。 二者是通用 AI 的双核心底座,绝非替代关系。

3. 世界模型必备的三大能力

  • 表征学习(Representation):把高维传感器数据(视频、激光雷达)压缩成有意义的抽象概念,而非原始像素。
  • 预测(Prediction):推演未来环境状态,包括对"物体恒存性"(东西看不见了但依然存在)的建模。
  • 规划(Planning):在真正行动前,在内部"脑补"成千上万种动作序列,选出最优解。

这三点合在一起,让 AI 从"问答工具"变成了"自主智能体"。

二、底层原理:感知—建模—推理—行动闭环

目前产业落地的世界模型,普遍采用 V-M-C 三层架构(对应 2018 年 Ha & Schmidhuber 经典论文的结构),完美复刻人类"感知环境 → 脑补推演 → 决策执行"的认知闭环:

① 感知编码器 V(Vision)

摄像头、激光雷达、各类传感器采集的原始数据极其冗余。感知编码器的作用是降噪、提纯、压缩:把高维杂乱的原始环境数据,转化为简洁、可计算的隐空间特征,只保留支撑物理推演的核心信息。常用技术:VAE、β-VAE、MAE、V-JEPA。

② 记忆/动力学模型 M(Memory / Dynamics)

这是"世界模型"的内核。它在隐空间中建模状态→动作→下一状态的演化,学习重力、碰撞、摩擦等物理规律。常用技术:RSSM(循环状态空间模型)、Transformer、Diffusion。

③ 控制器 C(Controller)

根据隐状态和预测结果输出动作,再作用于真实/虚拟世界,产生新观测,指导下一步行动——形成完整闭环。

关键价值:把决策成本从物理世界转移到内部模拟。 一个掌握了世界模型的机器人,不需要在真实环境里每步都冒险试错,它可以在"脑海"中虚拟试错数万次,再选最优方案执行。NVIDIA Isaac Gym 已能在单张 GPU 上同时训练数千个并行环境的机器人策略;Dreamer 系列证明,仅从"梦境"中学习,就能在 90% 以上的任务里超越真实环境训练。

三、技术路线之争:五条路线,没有单一王者

2026 年的行业共识是:路线尚未收敛,各有适配场景。主流可分为五派:

路线

核心思想

标杆模型

最强优势

核心短板

视频生成派

预测未来帧,用视频学物理

OpenAI Sora 2、Runway

高保真、强视觉

物理一致性弱、算力大、长程易崩

抽象表征派(JEPA)

不预测像素,预测状态变化

Meta V-JEPA 2、LeCun 的 AMI Labs

数据效率高、上限高

难可视化、训练慢

3D 空间派

显式三维几何 + 物理规则

World Labs Marble、OccWorld

空间结构长期一致

3D 数据稀缺、算力昂贵

视频 Token 自回归

视觉 Token 序列预测

Google Genie 3

架构成熟、易落地

视觉细节失真、长时序幻觉

具身 RSSM 控制派

内置模拟器服务决策

DreamerV3

强化学习闭环、自主探索

虚实鸿沟、长规划误差累积

现实做法是融合:自动驾驶方案 = 3D 占据空间模型 + 具身 RSSM 决策;虚拟数字人 = AR-DiT 视觉生成 + 3D 几何约束。短期各自深耕细分赛道,长期融合统一是通往"物理 AGI"的必经之路。

四、学术脉络:从"在梦里训练"到"世界动作模型"

世界模型并非新概念,它的演进脉络清晰可查:

  • 2018|World Models(Ha & Schmidhuber):把智能体拆成 V-M-C 三块,先学世界、再在"梦境"里训练控制器。范式的起点。
  • 2019–2023|PlaNet / Dreamer V1-V3:从像素学隐空间动力学,在想象 rollout 里学策略。DreamerV3 已覆盖 800+ 任务
  • 2020–2024|MuZero / EfficientZero / TD-MPC2:不再重建像素,直接预测 reward/value/policy。
  • 2023–2025|I-JEPA / V-JEPA / V-JEPA 2(Meta):不预测像素,预测语义/物理表征。
  • 2024–2025|Genie / UniSim / Cosmos / Marble:世界模型变成可交互、可生成、可产品化的基础模型。
  • 2025–2026|走向 World Action Model(WAM):同步建模视频与动作(Motus、DreamDojo、DreamZero)。

值得关注的是两篇重要综述:

  • 2026 年 6 月,26 位学者联合发表综述论文(arXiv:2606.00133),提出架构—方法论—推理范式—应用四维分类法,填补了长期缺乏统一框架的空白。
  • 2026 年 6 月 10 日,arXiv 发布《面向具身智能的世界模型综述》,提出功能—时间—空间三轴分类框架,为学术界与工业界提供标准化"导航图"。

五、落地场景:已经不是 PPT,是量产

1. 自动驾驶——最快商业化

自动驾驶是世界模型落地最快的领域。

  • Waymo World Model(2026 年 2 月 6 日发布):建立在 Google Genie 3 之上,能生成龙卷风、洪水、甚至"路上出现大象"等极端边缘场景,让 Robotaxi 在无限多种模拟里反复练习,而无需真把车开上路撞一次。
  • 特斯拉 Neural World Simulator蔚来 NWM(2024 年已推出)、Momenta R7 强化学习世界模型(2026 年 4 月北京车展量产首发,分"预训练—仿真—强化学习"三层)。
  • 2026 北京车展上,小鹏宣布投入 70 亿元研发物理 AI,吉利发布搭载 WAM 世界动作模型的 Eva Cab,华为 ADS 5.0 引入云端世界模型——"世界模型"成为全场关键词。

2. 机器人——装上"认知大脑"

  • Meta V-JEPA 2-AC(动作条件化变体):用 100 万小时视频 + 100 万图像预训练,仅用 62 小时机器人数据微调,就能在未知环境对未见过的物体实现 65–80% 零样本抓取成功率。
  • NVIDIA Cosmos 被 1X、Agility Robotics、Figure AI 等用于训练人形机器人。
  • 国内:腾讯 Tairos 具身大模型驱动宇树 G1 机器人"小莫",2026 年 1 月在敦煌莫高窟数字展示中心上岗,成为全国首个文博场景落地的 AI 导览人形机器人;腾讯 WAIC 2026 发布的 Hy-Embodied 系列具身基座模型,在日化工厂实测作业成功率 > 95%、单件节拍 < 6 秒。

3. 内容 / 游戏——最"讨喜"的应用

Genie 3、Marble 都能从一句文字生成"可以走进去探索"的世界,是游戏原型开发、虚拟场景搭建的直接生产力工具。Runway、Luma 等视频生成厂商也正把"懂物理"的模型往世界模型方向转型。

4. 工业数字孪生与科学研究

世界模型融合数字孪生,可缩短研发周期、降低运维成本;在气象、制药、材料领域,DeepMind GraphCast、AlphaFold、NVIDIA Earth-2 等已用"世界建模"思路替代传统数值计算,推理速度提升成百上千倍。

六、产业现状与巨头卡位

国际玩家

  • NVIDIA Cosmos:2025 年 1 月 CES 发布,含 Transfer / Predict / Reason 三模型,开源(Apache 2.0)下载量已超 200 万次,训练于约 2000 万小时真实世界视频。2026 年 6 月 1 日 GTC 台北,黄仁勋发布 Cosmos 3——一个混合 Transformer 全模态模型,统一视觉推理、世界生成与动作预测。被戏称为"世界模型的 CUDA"。
  • Google DeepMind Genie 3:2025 年 8 月发布,首个通用实时交互世界模型,24fps / 720p / 约 1 分钟视觉记忆;2026 年 1 月 29 日向美国 Google AI Ultra 订阅用户开放。
  • Meta / Yann LeCun:JEPA 架构代表作 V-JEPA 2。LeCun 于 2025 年 12 月离开 Meta 创办 AMI Labs(巴黎),押注非生成式表征路线,融资规模达数亿至十亿美元级。
  • OpenAI Sora 2:2025 年 9 月 30 日发布,定位"世界模拟器",强调物理一致的运动(如篮球正确弹框)。
  • World Labs(李飞飞)Marble:2025 年 11 月商用,从文本/图像生成持久 3D 世界,可导出游戏引擎,2026 年初融资超 10 亿美元。

中国力量

  • 腾讯:2026 年 4 月 16 日开源 HY-World 2.0(混元 3D 世界模型 2.0),可一键生成可交互 3D 虚拟世界并导入游戏引擎;WAIC 2026 进一步展示混元 Hy3 与具身智能全栈能力。
  • 阿里:同一天(2026 年 4 月 16 日)发布 Happy Oyster,主打"生成一个可持续存在、可实时交互的世界"。
  • 车企阵营:蔚来 NWM、小鹏(70 亿物理 AI 投入)、吉利 Eva Cab(WAM)、华为 ADS 5.0、Momenta R7 等密集落地,几乎"人人都在谈让 AI 进入物理世界"。

七、三座大山:挑战与争议

讲完"好事",也得讲真话。世界模型目前仍处在比当年训练 GPT-4 更烧钱、且瓶颈未破的阶段:

  1. 算力大山:一个具身智能世界模型所需算力可能比训练 GPT-4 还高数倍。特斯拉的算力目标高达 100 EFLOPS(约 30 万张 A100,单硬件投资约 30 亿美元)。
  2. 数据大山:LLM 用的是互联网上海量公开文本;世界模型要的三维物理交互数据(带质量、摩擦系数标注),人类历史上几乎不存在。整个产业都卡在同一个瓶颈上。
  3. 责任大山:LLM 说错话,道个歉就过去了;但一辆车的世界模型在极端天气里判错刹车距离,责任归谁?
  4. 技术本身未收敛:长时域累积预测误差、仿真到现实的"虚实鸿沟"、缺乏统一评测基准,仍是开放问题。

正如一篇 2026 年 5 月的基准测试所示:当前模型面对全新场景仍较脆弱,难以在长序列中保持物理一致性。"生成派"还是"表征派"最终谁通向 AGI,至今没有定论。

结语:从"会聊天"到"懂世界"

世界模型不是又一个被炒热的概念,而是 AI 从"处理文字图像"走向"理解真实物理世界"的关键一步。

它补齐了 LLM 的最后一块拼图——让 AI 不只是"道理全懂、实事难办",而是能感知、会推演、可行动

短期看,它会先在自动驾驶、机器人、工业仿真、内容生成里兑现价值;长期看,当"LLM 大脑"与"世界模型躯体"真正融合,AI 才第一次有可能从屏幕里走出来,成为能在现实世界里干活的伙伴。

2026,或许正是这场范式跃迁的起点。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐