arXiv:面向具身智能的世界模型综述
导语
机器人自主操作、自动驾驶预判、智能体想象式决策的背后,是世界模型,具身人工智能的内部模拟器。它赋予智能体感知、预测与规划能力,是下一代通用人工智能的核心基石。这篇工作首次提出功能-时间-空间三轴统一分类框架,系统梳理世界模型从决策专用到通用模拟的演进脉络,量化对比全球顶尖模型性能,深度剖析领域核心挑战与未来方向,为学术界构建了全景式知识图谱,也为工业界技术落地指明了清晰路径。
关键词:世界模型(World Models),具身人工智能(Embodied AI),时间建模,空间表示,自主智能体 (Autonomous Agents)
王璇丨作者
赵思怡丨审校

论文题目:A Comprehensive Survey on World Models for Embodied AI
论文链接:https://arxiv.org/html/2510.16732v1
发表时间:2025 年 10 月 19 日
论文来源:arXiv
从认知科学到通用模拟器:世界模型的进化之路
世界模型的思想根植于认知科学,人类通过大脑内部模型整合感官、预判事件、指导行动。受此启发,早期AI将其引入基于模型的强化学习,通过学习环境状态转移提升样本效率与规划能力。2018年Ha与Schmidhuber的开创性工作正式确立"世界模型"概念,证明循环神经网络可编码环境状态、模拟未来轨迹以驱动策略优化,直接催生了经典的Dreamer系列模型。
大规模生成式与多模态学习的爆发,推动世界模型从任务专用的决策辅助工具,进化为高保真通用环境模拟器。OpenAI Sora、Meta V-JEPA 2等模型不仅能生成长时序连贯视频,更能捕捉复杂物理规律与物体交互,为跨领域具身智能奠定了通用基础。
但领域的快速发展也导致术语混乱、分类体系割裂,现有综述多局限于功能视角或自动驾驶等单一应用,缺乏覆盖全主流方法的统一框架。本次综述提出的功能-时间-空间三轴分类法,正是为解决这一痛点而生,从三个核心维度构建了逻辑自洽的分类体系,为领域研究提供了标准化分析工具。
三轴统一框架:拆解世界模型的核心设计维度
三轴分类框架是该综述的核心贡献,它从功能耦合性、时间建模方式、空间表示策略三个相互关联的核心维度,厘清了世界模型的设计逻辑与技术路线。

图1. 该综述的结构。沿三个轴对全球模型进行分类,并展示每种方法的代表性方案,为该领域提供了统一的视角
功能维度上,世界模型呈现决策耦合与通用目的的分野。决策耦合模型与下游任务深度绑定,在特定领域数据上训练,以实时高效的控制为目标,代表如覆盖800+任务的DreamerV3、自动驾驶MILE、机器人操作ManiGaussian。通用目的模型则在大规模无标注数据上预训练通用物理规律,以跨域泛化为核心优势,典型如Sora、V-JEPA 2,但存在训练成本高、通用表示与具体决策衔接难的问题。
时间建模维度,核心是序列模拟与全局预测的权衡。序列模拟采用自回归方式逐帧推演,结构紧凑、样本效率高且天然支持闭环控制,从早期RNN到如今的Transformer 状态空间模型(TSSM)、状态空间模型(SSM)如 Mamba均属此类,但存在长时序误差累积的致命缺陷。全局差异预测并行估计完整未来序列,通过全局约束缓解误差,以JEPA系列为代表,却难以适配需要逐步决策的控制场景,当前研究正朝着融合两者优势的方向推进。
空间表示维度,呈现从低维抽象到高维几何的进化路径。全局隐向量计算高效但丢失细粒度空间信息,是早期模型的主流选择。令牌特征序列依托Transformer与LLM技术,成为当前跨模态建模的主流。空间隐网格凭借BEV、体素等几何先验,在自动驾驶领域广泛应用;分解渲染表示则基于3D 高斯溅射(3DGS)和神经辐射场(NeRF)等技术,通过可微渲染实现视角一致、物理可信的高保真预测,是当前最前沿的研究方向。
数据、评估与领域核心挑战
数据与评估是世界模型发展的核心基础设施,基于统一框架的量化对比则清晰呈现了领域进展与现存瓶颈。将数据资源划分为四类:仿真平台(MuJoCo、CARLA等)提供可控可扩展的虚拟环境,交互式基准(DMC、RLBench等)建立标准化性能标尺,百万级轨迹的OXE等离线数据集支撑跨具身预训练,Franka、Unitree系列等真实机器人平台完成物理世界验证。评估体系呈三层递进:像素级质量(FID、FVD等)、状态级理解(mIoU、mAP等)、任务级性能(成功率、样本效率等),但当前指标过度侧重像素保真度,忽视了物理一致性与因果推理等具身核心能力。

表1. nuScenes验证集上开环规划的性能对比
基于统一框架的量化对比显示,DrivePhysica、MiLA分别领跑自动驾驶视频生成的视觉保真度与时间一致性,COME在4D占用预测中表现最优,基于逆动力学的VidMan在机器人操作任务中成功率领先,SSR则在开环规划中实现最低碰撞率。尽管进展显著,领域仍面临三大核心挑战:一是数据与评估碎片化,缺乏跨域统一数据集与物理导向的评估标准;二是计算效率瓶颈,Transformer、扩散模型的推理成本难以满足实时控制需求;三是建模策略的固有矛盾,自回归的误差累积、全局预测的交互性不足、空间表示的效率与表达性失衡,共同限制了长时序复杂任务的落地。
未来展望:走向统一、高效、物理可信的世界模型
针对上述挑战,综述指出了未来的研究方向。在数据与评估方面,需要构建统一的多模态跨域数据集,并发展能够评估物理一致性、因果推理和长时序动态的新型指标。在计算效率方面,模型压缩技术和新型架构是重要的突破点,它们有望在保持性能的同时,实现实时推理。在建模策略方面,融合自回归和全局预测的优势、引入显式 3D 几何先验和物理约束、结合大语言模型的推理能力,将是构建下一代通用世界模型的关键路径。
世界模型作为具身 AI 的核心,正在经历从专用到通用、从 2D 到 3D、从像素到物理的深刻变革。这篇综述提出的三轴统一框架,不仅为学术界梳理了清晰的研究脉络,也为工业界的技术落地提供了重要参考。随着数据、算法和算力的持续进步,我们有理由相信,未来的世界模型将能够像人类大脑一样,构建出物理可信、因果一致的内部世界,真正实现感知、预测与决策的统一,为通用人工智能的到来奠定坚实基础。
世界模型读书会
目前,世界模型并非边界明确的单一技术范式。强化学习、生成模型、认知科学、具身智能与复杂系统等领域,对“世界”“状态”及其动力学机制有着不同理解。世界模型究竟应预测感知信号、学习隐空间中的状态转移,还是刻画行动、物理约束与因果关系?预测能力又如何转化为有效的规划、决策和行动?这些问题仍有待系统梳理。
为此,集智俱乐部联合认知科学、具身智能、AI Agent、复杂系统与高阶网络等领域的研究者发起「世界模型」读书会,围绕世界模型的思想源流、理论基础、技术路线与应用边界展开专题分享和讨论。读书会自2026年8月7日起,每周五晚19:30-21:30,将以“世界如何被表征、其动力学如何被建模、内部模型如何服务于智能体”为主线,尝试讨论整理世界模型统一框架。
详情请见:世界模型读书会启动:从内部表征到真实世界的智能
推荐阅读
1. 走向通用人工智能之路,世界模型为何不可或缺?
2. 基于世界模型的强化学习框架: 做梦者|集智百科
3. AI“社会实验室”:模拟大型社会互动的世界模型
4. 9900分可兑换“涌现”文化衫,报名任意读书会送299积分!
5. 集智学园精品课程免费开放,解锁系统科学与 AI 新世界
6. 高考分数只是张入场券,你的科研冒险在这里启航!
7. 加入集智字幕组:成为复杂科学知识社区的“织网人”
#速递
原标题:《arXiv:面向具身智能的世界模型综述》

