世界模型训练数据与物理表征
世界模型学习在给定当前观测与候选动作时,环境可能如何变化。训练样本因此要同时保存动作前状态、动作语义和真实后态;只保存好看的未来视频,无法判断模型是否支持控制。具身世界模型综述和世界动作模型综述都把预测与行动的联系放在核心位置;Riemann-1.0则给出多视角视觉、机器人状态与本体动作共用因果序列的实例。
概念与数据问题
Section titled “概念与数据问题”这里的世界状态可以是图像、潜在向量、三维点集或显式物体状态。PointCast用物体和末端执行器的三维点及点身份表示不同形变类型;Programmable World Model把状态演化与画面生成分开;WorldCrafter使用可由相机视角查询的三维感知记忆。表示不同,数据必须回答同一问题:同一起点在不同动作下,哪些变化由动作导致,哪些只是视角或渲染变化?IMPLY强调仅让预测彼此一致不足以证明符合物理;Frozen Flows Forget展示潜在预测可能丢失操作所需的运动。
采集、处理与对齐
Section titled “采集、处理与对齐”采集时为每个 episode 记录相机、关节/末端状态、控制命令、物体与任务条件,并保存发令和实际执行时间。CLAP利用人和机器人等异构视频讨论跨本体学习;XPACE联合世界与动作建模;Underwater C3-JEPA说明水下多视角与控制信号需要同步。跨本体样本应保留原始动作接口和转换规则,不宜把不同机器人命令直接拼成同一数值列。
处理时区分背景、目标与接触对象,再生成可追踪的派生状态。AcrossVAM1.0将物体运动与外观分开,DUET-DINO联合侧视与腕视潜在预测,AlayaVista处理宽视场状态到局部画面的生成,MoWAM用显式未来运动减轻视频生成开销。这些路线提示:物体身份、相机位姿和运动轨迹应作为可复查中间产物。
对齐时明确预测跨度、动作生效时刻和观测间隔。CST-WM关注自运动与遮挡下的目标可观测性;Semigroup-JEPA检验不同时间步的动力学一致性;Movement Trend Guidance把未来运动趋势用于三维策略。DIDO说明互动区域与静态背景在生成过程中的收敛速度不同,故不能只靠全帧平均误差判定数据与模型质量。
最小字段契约
Section titled “最小字段契约”字段名是建议的数据接口,不表示所引论文使用完全相同的文件格式。
| 字段 | 记录内容 | 检查重点 |
|---|---|---|
| episode_id / step_id | 任务与时间链唯一键 | 拆分训练集时整条 episode 隔离 |
| camera_id / calibration_id | 相机来源、外参与标定版本 | 多视角重投影一致 |
| observed_at / acted_at | 观测、发令和生效时间 | 延迟与预测跨度可计算 |
| robot_id / action_schema | 本体、自由度、单位与控制模式 | 跨本体转换可回溯 |
| object_track_id / pose | 目标身份、位姿与遮挡状态 | 失跟踪不伪作静止 |
| future_target / horizon | 实测未来视频、点轨迹或潜在目标 | 目标来自动作后真实观测 |
| physics_context | 材质、接触或环境参数(若可得) | 未知值明确为空而非默认 |
| quality_flags | 模糊、遮挡、碰撞、漂移与同步质量 | 可按失败机制筛选 |
训练前应检查时间戳单调、控制命令与实测运动一致、跨视角物体身份连续,以及已知物理量的单位。PhysBrain 1.5把语言、末端运动和视觉目标统一编码;Successive Capacity Growth研究编码器容量与任务复杂度。这类模型比较只有在数据划分和输入粒度一致时才有意义。
评估至少分三层:一是事实后态预测;二是同一起点的多动作比较与跨时间物理一致性;三是把预测接入真实或仿真控制后看任务结果。IMPLY提供物理锚定的滚动预测检查,PointCast关注点轨迹,Underwater C3-JEPA关注跨视角控制条件。报告时保留运动区域与静态区域的分项指标,避免背景质量掩盖接触错误。
数据集使用边界
Section titled “数据集使用边界”The Past Frames the Future讨论长视频生成在有限上下文中丢失历史信息的问题,它可为记忆设计提供参考,但通用视频质量不能直接代表机器人控制能力。世界模型在训练集外的本体、材质、光照或动作幅度上应单独验证;如果模型未见接触类型,就不应把生成画面当作安全执行证据。论文中不同表示与任务协议不能直接合并为一个排行榜。
以下论文按清单中的主主题归档。跨主题使用时,应重新核对任务、传感器和评测口径。
- CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators(2608.27406)
- Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models(2608.27367)
- Riemann-1.0: An Embodied World Action Model for Physical AI(2608.27033)
- AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction(2608.28491)
- CST-WM: A Causally Structured World Model for Embodied Visual Tracking(2609.06302)
- Programmable World Model(2609.10540)
- DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation(2609.10506)
- Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization(2609.10464)
- XPACE: Joint World and Action Modeling from Heterogeneous Experience(2609.17372)
- World Models for Embodied Intelligence: From Plausible to Controllable to Actionable(2609.16697)
- DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models(2609.15570)
- PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models(2609.14973)
- World-Action Models for Robot Learning and Control: A Survey(2609.16074)
- AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video(2609.14462)
- IMPLY: Physically Anchored Consistency for World-Model Rollouts(2609.12441)
- MoWAM: Explicit Future Motion Prediction for Efficient World Action Models(2609.20709)
- Learning Foresight without Explicit Trajectories for 3D Diffusion Policies(2609.20669)
- WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory(2609.24984)
- The Past Frames the Future: Memory for Autoregressive Video Generation(2609.28466)
- Frozen Flows Forget: Diagnosing and Restoring Lost Motion in a Latent-flow World Model(2609.28414)
- PointCast: One World Model for Rigid, Articulated, and Deformable Object Manipulation(2609.28393)
- Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage(2609.30214)