具身智能数据术语表
这页专门解释主文档里不得不用到的词。每个词都尽量降低理解门槛,不要求先有数学或机器人基础。

具身智能数据
Section titled “具身智能数据”具身智能数据,就是带着“身体”和“环境”的智能数据。
它通常不只是图片或文字,还会包含机器人在哪里、看向哪里、做了什么动作、传感器读到了什么、环境发生了什么变化。和普通网页数据相比,它更强调时间、空间和动作之间的关系。
传感器数据就是设备从真实世界采回来的原始记录。
摄像头给图片,麦克风给声音,运动传感器给晃动和加速度,轮子编码器给轮子转了多少。具身智能系统要把这些零散记录对齐后,才更容易判断“当时到底发生了什么”。
时间戳就是一条数据发生的具体时间。
它像给每张图片、每条传感器读数贴上时间标签。没有时间戳,很多数据就很难拼在一起。
数据对齐就是把不同来源的数据按时间或空间配到一起。
例如某张图像应该对应哪一条运动传感器记录、机器人当时在哪个位置、机械臂当时伸到哪里。对齐错了,后面的训练、标注和评估都会跟着错。
轨迹数据记录的是设备一路怎么走。
它通常包含一串时间、位置和朝向。具身智能里,轨迹数据常用来回放采集过程、训练导航模型、评估定位结果。
Episode
Section titled “Episode”Episode 是一次任务尝试或一次完整采集片段。
它通常有明确开始和结束,包含任务说明、场景、设备、执行过程、成功或失败结果,以及为什么结束。对具身智能数据来说,episode 是采集、质检、训练划分和评估统计里很重要的管理单位。
Trajectory
Section titled “Trajectory”Trajectory 是按时间排序的一串观测、状态和动作。
它强调“过程怎么连续变化”。一个 episode 里通常会有一条主 trajectory,也可能有多条并行 trajectory,例如机器人末端轨迹、相机轨迹、物体轨迹和 SLAM 估计轨迹。
Step 是 trajectory 里的一个时间步。
它通常记录这一刻的观测、机器人状态、动作、奖励或边界标记。图像、关节角、末端位姿和夹爪宽度都可能出现在同一个 step 里。
Transition
Section titled “Transition”Transition 是从一个 step 到下一个 step 的状态变化记录。
在强化学习数据里,它常表示“当前观测 + 当前动作 + 下一观测 + 奖励 + 是否结束”。在机器人数据里,还要特别注意动作和图像是否在同一时间线上。
Episode 边界
Section titled “Episode 边界”Episode 边界就是一次数据片段从哪里开始、到哪里结束。
边界可能来自人工按键、任务成功事件、超时、传感器丢失或后处理裁剪。边界不清楚时,训练窗口可能跨到另一段任务里,动作标签也容易错位。
窗口采样就是从较长 episode 或 trajectory 里切出固定长度的小片段给模型训练。
例如模型看过去几帧图像,再预测未来几步动作。窗口采样要保证不会跨 episode,也要说明动作标签相对观测有没有延迟。
标定文件记录传感器的关键参数。
它告诉系统镜头怎么变形、传感器之间怎么安装、数据该怎么换算。标定文件用错,就像戴着度数不合适的眼镜看世界。
相机内参描述一台相机怎样把相机坐标系中的三维光线投到像素坐标。
常见字段包括焦距 fx、fy,主点 cx、cy,以及镜头畸变参数和畸变模型。它属于相机自身的成像几何,不描述相机在世界中放在哪里;后一类关系是外参。对具身智能数据,内参必须与图像的实际分辨率、裁剪、缩放、去畸变状态和相机 ID 一起保存,否则像素标注无法可靠转换为射线、三维点或机器人可用的空间目标。
畸变模型规定怎样校正镜头让直线在图像边缘弯曲、或者鱼眼视角被压缩的现象。
它不只是几组系数;读取方还必须知道模型名称、参数顺序及这些参数对应原始图像还是已去畸变图像。普通针孔相机常使用径向和切向畸变模型,广角或鱼眼相机则常有专用模型。模型与参数不匹配时,中心区域看起来可能正常,边缘的投影、测距和标注对齐却会明显出错。
重投影误差是把已知三维点按标定参数投回图像后,与实际观测像素之间的差距,通常以像素为单位。
它是检查标定拟合质量的重要指标,但不能单独决定数据是否可用。还应查看误差是否集中在图像边缘、不同距离和不同姿态下是否稳定,以及标定文件是否仍匹配当前图像处理链路。
SLAM 是“同时定位和建图”的缩写。也就是机器一边走,一边回答两个问题:
- 我现在大概在哪里?
- 我走过的地方大概长什么样?
扫地机器人、无人机、AR 眼镜、自动驾驶小车都会遇到这类问题。
“视觉”是摄像头看到的画面。“惯性”是运动传感器感到的转动、加速和晃动。
视觉惯性就是把“看见了什么”和“身体怎么晃了”合在一起判断运动。
IMU / 运动传感器
Section titled “IMU / 运动传感器”IMU 是一个常见缩写,可以先理解成“运动传感器小盒子”。
它通常能测两类东西:
- 设备转得有多快。
- 设备加速或减速得有多明显。
手机横竖屏切换、手柄体感、无人机稳定飞行,都离不开这类传感器。
加速度计测量的是设备在三个轴上的比力,单位通常是 m/s^2。
设备静止时它也会受到重力影响,因此原始加速度不等于“设备正在直线移动的加速度”。做移动设备数据采集时,要同时记录坐标轴约定和单位,之后才可正确去除重力或转到相机、机器人坐标系。
陀螺仪测量的是设备绕三个轴转动的角速度,单位通常是 rad/s。
它对快速转动很敏感,能补充相邻视频帧之间的动作;但静止时的微小偏置经过长时间积分也会逐渐积累成姿态误差。因此采集 session 常保留开头和结尾的静止片段来检查偏置与噪声。
传感器偏置是传感器在理论上应输出零时仍稳定存在的偏移量。
例如手机静止放好后,陀螺仪可能持续输出很小的非零角速度。偏置会受温度、设备和时间影响。原始数据不应被覆盖;偏置估计和去偏结果应作为可追溯的派生数据保存。
采样率是传感器每秒记录多少个样本,常用 Hz 表示。
应用请求 200 Hz 不代表设备一定实际稳定输出 200 个样本。移动设备会受硬件上限、操作系统调度、功耗和发热影响,所以数据质检应根据相邻时间戳统计实际间隔、抖动和缺口。
设备坐标系是以手机、相机或其他设备自身为原点定义的三维轴方向。
IMU 的 x/y/z 值首先属于设备坐标系。要和相机、夹爪或机器人基座的数据一起用,必须保存它们之间的旋转和平移关系;横竖屏 UI 变化本身不能替代这份坐标变换。
重采样是把不等间隔或不同频率的数据转换到新的时间网格上。
例如把高频 IMU 流切成每个视频帧附近的固定时间窗口。重采样必须记录目标频率、插值方法和缺口处理方式,不能只按数组下标把图像与 IMU 硬配在一起。
Allan 方差
Section titled “Allan 方差”Allan 方差是一种分析传感器噪声和随时间漂移特性的统计方法。
它常用较长的静止 IMU 记录来区分白噪声、随机游走和偏置不稳定性。对移动设备采集,它适合比较机型或硬件配置,但不是每个训练数据集都必须计算的指标。
YUV / YCbCr
Section titled “YUV / YCbCr”YUV 在 Android 相机和视频处理中常用来泛指亮度加色差信号,更准确地说很多场景是 YCbCr。
它把画面拆成亮度 Y 和两个色度通道 U/Cb、V/Cr。对具身智能数据来说,YUV 的价值是采集和传输效率高,但使用时必须记录格式、stride、时间戳和颜色转换方式,否则模型输入和标注预览可能不一致。
YUV420
Section titled “YUV420”YUV420 是一种色度降采样格式。
它保留每个像素的亮度,但让 2x2 四个像素共享一组色度信息。因此 8-bit YUV420 通常约等于 12 bit 每像素,比 RGB888 更省带宽,常见于 Android 相机分析流和视频编码。
I420 是一种常见的 YUV420 平面布局。
它按 Y 平面、U 平面、V 平面的顺序连续存储。很多图像处理库会把其他 YUV 布局先转换成 I420,再做缩放、旋转或 RGB 转换。
NV21 是一种常见的 YUV420 半平面布局。
它先存完整 Y 平面,再把 V 和 U 交错存储。Android 旧 Camera API 的预览默认常见 NV21;使用 Camera2 或 CameraX 时,不应直接假设 YUV_420_888 的底层内存就是 NV21。
Row Stride
Section titled “Row Stride”Row stride 是图像某个平面里相邻两行起点之间相隔的字节数。
它可能大于图像有效宽度,因为每行末尾可能有 padding。读取 Android YUV plane 时,如果忽略 row stride,图像容易出现错行、斜纹或颜色错位。
Pixel Stride
Section titled “Pixel Stride”Pixel stride 是同一行里相邻两个采样点之间相隔的字节数。
在 Android YUV_420_888 中,Y 平面的 pixel stride 保证为 1;U/V 平面的 pixel stride 可能是 1,也可能是 2。处理 U/V 时必须按这个值取样,不能只按连续数组读取。
VIO 可以理解成“视觉惯性定位”。
它主要关心“我怎么移动了”,不一定负责长期保存和维护完整地图。SLAM 则更强调“定位”和“建图”一起做。
Ego 视角
Section titled “Ego 视角”Ego 视角就是第一人称或本体视角。
在具身智能数据里,它通常表示相机跟着执行者移动:人戴着眼镜、机器人头部相机看世界,或像 UMI 那样把相机装在手持夹爪上。它记录的是“执行者当时能看到什么”,适合学习操作过程中的接触、遮挡和物体状态变化。
世界模式就是把采集到的数据放回一个较稳定的环境坐标系里。
例如用 SLAM 地图、桌面标记板或房间坐标系来描述相机和夹爪在哪里。它关心环境、地图、位姿和坐标对齐,方便比较不同演示和不同设备采集的数据。
操作模式就是数据怎样表达“下一步怎么动”。
它可以是绝对末端位姿、相对当前位姿的未来轨迹,也可以是每个控制周期的小增量。对模仿学习来说,操作模式会直接影响模型学到的动作是否容易跨场景、跨机器人复用。
UMI 是 Universal Manipulation Interface 的缩写,可以理解成一种手持夹爪式操作数据采集框架。
它把 GoPro 摄像头、IMU、夹爪标记和后处理管线结合起来,让人在真实场景中用夹爪演示任务,再把视频处理成机器人策略可以学习的图像、末端轨迹和夹爪宽度数据。
Project Aria
Section titled “Project Aria”Project Aria 是 Meta 用于第一人称多模态研究的眼镜设备和工具体系。
在具身智能数据里,它常被当作头戴式 ego 传感器平台:可以记录相机、运动传感器、音频、眼动和标定信息,再通过后处理得到轨迹、点云、眼动和手部状态等数据。
VRS 是 Vision Replay Systems 的缩写,是 Meta 开源的多传感器记录格式;Project Aria 用它保存设备级原始记录,但 VRS 本身不只服务于 Aria。
普通视频文件主要保存画面和声音;VRS 可保存多条 sensor stream、共同时间域里的记录、配置、状态与数据内容块。读取 VRS 时,通常需要 VRS 或 Project Aria Tools 这类专门工具,而不是只用普通视频播放器。它解决“如何高保真记录”,不自动解决“不同设备的单位、坐标系和任务标签是否一致”;这部分需要由数据集 schema 明确规定,见Meta VRS 多传感器数据规范。
Stream
Section titled “Stream”Stream 是同一种来源按时间持续写入的一路记录,例如一台 RGB 相机、一个 IMU 或一个麦克风。
不同 stream 的采样率、缺失情况和配置变化都可能不同。因此跨 stream 对齐应使用时间戳和规定的容差,不能只按“第几条记录”或“第几帧”直接配对。
时间域是一个时间戳数值所依附的时钟体系。
同一个 VRS 文件里的 stream 共享文件时间域,但多个设备的 recording 不一定天然处在同一时间域。跨设备数据还需要保存时钟映射、同步方法和最大误差;否则多机位视频、机器人动作和 Aria 观测可能看起来同时,实际却存在系统性偏移。
MPS 是 Machine Perception Services 的缩写,可以理解成 Aria 原始数据的机器感知后处理服务。
Isaac Lab
Section titled “Isaac Lab”Isaac Lab 是建立在 NVIDIA Isaac Sim 之上的开源、GPU 加速机器人学习框架。它提供并行仿真环境、机器人和物体、物理与传感器模拟,以及强化学习、模仿学习和运动规划相关接口。
在具身数据链路中,Isaac Lab 更像仿真交互和数据生成层:它能批量产生观测、动作、状态、奖励、成功标记和仿真真值,但不会自动替代真实采集,也不是一个固定的数据集格式。使用它生成数据时,还要记录环境版本、资产、随机种子、坐标系、时间轴和质量标记。
Isaac Sim
Section titled “Isaac Sim”Isaac Sim 是 NVIDIA 面向机器人仿真的平台,提供基于物理的场景、资产、渲染和传感器能力。Isaac Lab 建立在 Isaac Sim 之上,为机器人学习任务提供更高层的环境、配置和训练工作流。
仿真器是模拟物理世界和机器人交互的软件:它计算物体的运动、接触、传感器读数,有时还包括图像渲染。对具身数据来说,仿真器的主要价值是可控地批量生成轨迹、状态、动作和仿真真值,代价是它与真实世界之间存在系统性差异。常见仿真器包括 MuJoCo、Isaac Sim、PyBullet、Gazebo、Genesis、SAPIEN、Habitat 等,横向对比见仿真器与具身数据。
MuJoCo
Section titled “MuJoCo”MuJoCo 是 Multi-Joint dynamics with Contact 的缩写,是 DeepMind 开源维护的高性能物理引擎,以接触建模稳定、速度快和模型格式简洁著称。它使用 MJCF 场景格式描述机器人、物体、传感器和执行器,是 dm_control、robosuite、D4RL 等许多数据集与 benchmark 的底层引擎。对具身数据,MuJoCo 适合生产轻量、高频的状态-动作轨迹和接触数据,详见MuJoCo 与具身数据。
MJCF 是 MuJoCo 的原生 XML 场景格式,一个文件同时描述模型几何、关节、执行器、传感器和相机。对数据集来说,MJCF 相当于“场景即数据契约”:机器人模型、任务布局和传感器配置都写在里面,因此数据集应保存 MJCF 的版本或哈希,否则轨迹无法复现。
dm_control
Section titled “dm_control”dm_control 是 DeepMind 基于 MuJoCo 的控制与机器人学习套件,提供环境构建、相机渲染、奖励分解和回放工具。它是 DeepMind 控制 suite 等 benchmark 的基础,也常被用来生产控制与视觉任务数据。
MJX 是 MuJoCo 的 JAX 版本:用 XLA 编译和 GPU 并行运行同样的 MJCF 模型。它把原本单机串行的仿真变成可大规模并行的数据生产工具,适合批量生成覆盖不同初始条件的轨迹。
PyBullet
Section titled “PyBullet”PyBullet 是 Bullet 物理引擎的 Python 绑定,直接支持 URDF 模型和简单相机、射线传感器。它上手快、依赖轻,适合教学、快速原型和小规模数据管线验证,物理与渲染精度有限,不适合作为高保真数据源。
Gazebo
Section titled “Gazebo”Gazebo 是 ROS 生态中最常用的机器人仿真平台,支持 SDF/URDF 场景、多类传感器和不同物理后端,常用于移动机器人和导航任务。对具身数据,它的价值在于和 ROS 采集、标定、真机工具链打通。
Genesis
Section titled “Genesis”Genesis 是 2024 年底开源的生成式物理引擎,把物理仿真、渲染和生成式能力放在一起,可以用自然语言生成场景、对象和机器人,并支持 GPU 并行。对具身数据,它适合探索场景与任务的自动生成和扩增,但仍在快速演进,使用时要注意版本与 API 变化。
SAPIEN
Section titled “SAPIEN”SAPIEN 是面向具身智能与机器人学习的交互式物理引擎,强调部件级关节体(柜门、抽屉、阀门等)的交互。ManiSkill 构建在它之上,提供大规模操作 benchmark 和标准化评测数据。
Habitat
Section titled “Habitat”Habitat 是 Meta 主导的仿真平台,主打高保真视觉导航、家务机器人场景和多智能体仿真,提供 photo-real 渲染与标准化评测。对具身数据,它适合导航、多智能体和视觉任务的数据生产与评测,物理操作不是它的强项。
领域随机化(Domain Randomization)是刻意让仿真在每次运行时随机化外观、物理参数、初始状态和扰动范围的做法,目的是让策略或数据覆盖更广的真实世界分布。它是缩小仿真与真实差距的重要手段,但随机化范围必须随数据记录,否则无法解释数据分布。
合成数据是由程序、仿真器或生成模型制造的数据,而不是从真实设备采集的数据。对具身智能,合成数据可以提供真实采集难以获得的大规模轨迹、标注和场景变体,但它需要与真实数据对照、校准后才能放心用于训练或评测。
程序化任务生成
Section titled “程序化任务生成”程序化任务生成是根据可复现的任务规格、场景资产和随机化配置,批量创建任务实例与具身数据的过程。输入包括任务目标、机器人本体、资产、布局、视觉和物理参数;输出包括任务变体、观测、动作、状态、成功标签和质量元数据。生成器还应保存版本、随机种子、参数快照与拒绝原因,避免“生成了很多”被误当成“数据可用”。
任务参数化是把任务中可变化的条件写成有类型、有范围和约束的字段,例如物体位姿、目标距离、摩擦、光照、控制延迟和初始状态。参数既定义生成器可搜索的输入空间,也成为下游按难度、覆盖和失败原因筛选数据的依据;越界、碰撞或不可达的参数组合应在生成阶段拒绝并记录。
任务变体是固定任务语义下,由一组具体参数、资产版本、场景布局和随机种子确定的一次可复现实例。它连接“任务规格”和“episode”:同一任务可有许多变体,一个变体也可产生多次尝试。训练、验证和评估应按资产或变体族隔离,防止相同外观或参数泄漏到评估集。
数据契约是生产者与使用者共同遵守的字段、单位、坐标系、时间语义、版本和质量准入约定。具身数据契约至少要说明 observation、action、state、事件、标签来源、episode 边界、标定、授权和 split;它描述输入如何解释、输出达到什么条件,而不是只规定文件格式。契约变更必须可追踪并能兼容或迁移已有数据。
众包数据采集
Section titled “众包数据采集”众包数据采集是由多个外部贡献者按任务分发规则完成具身任务并提交 episode 的采集方式。输入包括贡献者授权、任务变体、设备或浏览器环境和控制映射;输出包括操作者化名、会话、请求与实际动作、观测、任务结果和质量事件。准入不能只看成功率,还应检查重复提交、异常行为、时间对齐、物理可执行性、隐私和按贡献者分桶的质量差异。
浏览器遥操作
Section titled “浏览器遥操作”浏览器遥操作是操作者通过浏览器输入控制仿真器或机器人,并同步查看观测、状态和反馈的方式。数据记录应区分输入事件、控制映射后的请求动作、环境实际执行动作和网络时钟,保留延迟、丢包、重连及仿真或真实环境版本。浏览器能降低采集门槛,但不能替代时间同步、动作可执行性检查和 episode 质量验收。
模型条件化数据生成
Section titled “模型条件化数据生成”模型条件化数据生成是根据策略评估、失败模式、分布漂移或部署反馈,定向生成下一轮任务、仿真轨迹或人类采集请求的过程。输入包括策略版本、评估事件、任务参数空间、质量状态和采集成本;输出包括候选任务、选择理由、采样权重、数据来源及训练或评估 split。它应把“值得采什么”和“样本是否合格”分开,不能让模型自己的低质量解释直接成为标签。
失败挖掘是从 rollout、回放和部署反馈中识别高价值失败模式,并将其转化为可复现任务或采集队列的过程。除了失败原因,还应保留触发状态、策略与评估版本、置信度、物理事件和数据质量证据;成功但存在碰撞风险、严重延迟或不可执行动作的轨迹也应进入风险分析,而不应只按成功布尔值筛选。
采样权重表示某个任务变体或候选样本在下一轮数据生成中的相对优先级。权重应由失败价值、不确定性、分布缺口、违规风险和采集成本等版本化信号计算,并记录候选集合、归一化范围、裁剪配置和计算依据。权重只影响选择概率,不改变样本的质量结论,也不能让低权重样本从覆盖统计中消失。
数据血缘是记录数据从原始采集、处理、标注、审核、筛选到训练或评估使用的来源和变换关系。具身数据应能从 episode 回链到任务变体、设备、操作者或仿真配置、处理运行、模型版本和数据集快照,并保留参数、质量状态、授权和拒绝原因。血缘解决“这条数据怎么来的、被谁改过、用在哪里”,不能只用文件名或目录结构代替。
Provenance / 数据来源证明
Section titled “Provenance / 数据来源证明”Provenance 是对数据来源、归属、处理过程和使用授权的可验证记录。签名、哈希或链上记录可以证明某个 Data ID 或提交在某时刻存在并与某贡献者关联,但不能代替完整数据血缘、原始文件、许可条款、访问控制和质量报告。下游使用时应同时核验来源证明与数据契约。
Data ID
Section titled “Data ID”Data ID 是一个稳定、可查询且不依赖文件路径的数据对象标识符,可指向 episode、轨迹、任务变体或数据集版本。它应与来源证明、血缘、质量结论和授权记录关联,并在重采样、纠错或派生时区分父对象与新对象;Data ID 本身不是数据内容,也不等于样本已经通过训练准入。
URDF 是 Unified Robot Description Format 的缩写,是 ROS 生态里常用的机器人模型描述格式,主要描述关节、连杆、惯性、碰撞和视觉几何。许多仿真器(PyBullet、Gazebo、Isaac 等)可以导入 URDF;MuJoCo 需要从 URDF 转换到 MJCF,转换会丢失或改写部分信息,转换配置应随数据记录。
VLM 是 Vision-Language Model 的缩写,即视觉语言模型。它把图像或视频和语言放在同一个理解框架中,可以回答视觉问题、识别空间关系、生成任务计划或调用工具。在具身智能数据里,VLM 的输出还需要绑定时间、坐标系、置信度和任务状态;它能理解“把杯子放到左边”,不代表它已经给出了可执行的关节动作。
VLA 是 Vision-Language-Action 的缩写,即视觉—语言—动作模型。它把视觉观测、语言指令和可能的机器人状态映射成动作或动作片段,例如末端位姿、关节命令和夹爪控制。VLA 数据必须说明动作的表示方式、控制频率、延迟、预测窗口、坐标系和停止条件,否则同一个数值数组可能被不同控制器解释成完全不同的动作。
Pre-training / 预训练
Section titled “Pre-training / 预训练”Pre-training(预训练)是用较大规模、通常较广覆盖的数据建立模型基础能力的阶段。具身数据应明确示范、合成数据和真实观测的来源、任务与资产覆盖、去重规则、授权和训练版本;预训练数据不应默认包含后续评估集或未经审核的部署反馈。
Post-training / 后训练
Section titled “Post-training / 后训练”Post-training(后训练)是在已有模型基础上,利用针对性示范、纠错轨迹、偏好或安全数据改善特定任务和闭环行为的阶段。后训练记录应关联父策略版本、数据选择理由、动作来源、质量门和隔离评估结果;少量高价值纠错数据可以改变策略,但不能据此宣称覆盖了更广泛的任务分布。
Human-gated DAgger
Section titled “Human-gated DAgger”Human-gated DAgger 是由策略先执行 rollout,在低置信度、风险或失败征兆出现时由人类接管并提供纠正,再将带有门控边界的轨迹用于后训练的方法。数据必须保存父 rollout、策略与人类动作、接管和交回时间、触发原因、环境状态、回放结果与安全事件;人工接管不自动意味着纠正标签正确或样本可训练。
纠错轨迹是包含策略原动作和人类纠正动作的时间序列,重点描述策略在哪个状态出错、何时被接管以及如何恢复。它应区分观测时间、请求动作和实际生效动作,保存父 episode、接管区间、动作来源、质量审核和重放结果;缺少这些边界时,它只能被视为普通示范,难以用于分析策略缺口。
Embodied Reasoning
Section titled “Embodied Reasoning”Embodied reasoning 可以译为具身推理,指模型结合视觉、语言、空间关系、机器人状态和环境反馈来理解并规划物理任务。它比普通图像问答多了动作后果、可达性、进度和安全约束。在 VLM + VLA 系统中,具身推理通常位于高层,负责拆分任务、调用工具和触发重规划;VLA 再执行具体动作。
Action Chunk
Section titled “Action Chunk”Action chunk 是一次预测的一小段连续动作,而不是单个控制周期的动作。使用 action chunk 可以减少高频调用模型的成本,但数据必须保存动作起始时间、控制频率、窗口长度和执行过程中是否被提前打断。否则离线动作误差和真实闭环延迟无法正确比较。
Closed-loop Evaluation
Section titled “Closed-loop Evaluation”Closed-loop evaluation 是闭环评测:模型输出的动作真正作用于仿真或真实环境,环境变化后的新观测再返回模型。它和只比较模型预测与示范动作的离线评测不同,更能测出误差累积、接触失败、恢复能力、重规划和安全停止。闭环成功率应同时报告任务定义、尝试次数、失败原因和人工接管情况。
Covariate Shift / 共变量偏移
Section titled “Covariate Shift / 共变量偏移”Covariate shift(共变量偏移)是训练数据与评估或部署数据的输入分布不同,但目标定义基本不变的情况。具身数据评估应按任务、场景、物体、操作者和传感器条件检查这种偏移,避免把分布变化误判为模型能力变化。
Bootstrap Confidence Interval / Bootstrap 置信区间
Section titled “Bootstrap Confidence Interval / Bootstrap 置信区间”Bootstrap 置信区间是反复重采样评估 episode 并重新计算指标得到的不确定性范围。具身数据报告应明确按 episode、任务或主体重采样的单位,避免同一轨迹的帧被当成独立样本,并用区间表达成功率等指标的稳定程度。
Sim-to-real
Section titled “Sim-to-real”Sim-to-real 指把仿真中训练或验证得到的策略、数据和经验迁移到真实机器人。
它不是简单地把模型复制到硬件上,而是要检查仿真与真实世界在相机观测、动力学、摩擦、执行器延迟、传感器噪声、遮挡和任务分布上的差异。具身数据项目通常用真实小样本校准仿真,再用真实设备做最终验证。
它会从 VRS 等原始记录中生成更容易直接使用的数据,例如 6DoF 轨迹、半稠密点云、在线标定、眼动估计和手部跟踪。MPS 输出不是原始真值,使用时要注意版本、质量和坐标系。
Ego4D 是大规模第一人称视频数据集和 benchmark 体系。
它的重点是把来自真实生活场景的第一人称视频整理成可训练、可评估的数据:包括规范化长视频、任务 clip、元数据和多类 JSON 标注。对具身智能数据使用者来说,关键是把 video_uid、clip 时间范围和任务标注正确对上。
Ego-Exo4D
Section titled “Ego-Exo4D”Ego-Exo4D 是同步第一人称和第三人称视角的多模态多视角数据集。
它通常用 Aria 眼镜记录 ego 视角,同时用多个 GoPro 记录 exo 视角,并在 take 级别提供同步视频、相机标定、轨迹、点云、眼动和多类标注。它适合研究跨视角动作理解、三维姿态、技能评估和多视角对齐。
Canonical Video
Section titled “Canonical Video”Canonical video 是经过规范化处理后的主视频版本。
在 Ego4D 里,原始 video components 可能来自不同设备,帧率、音频和时基不完全一致。canonical video 会把这些片段整理成更稳定的长视频,方便标注、下载和训练使用。
Canonical Clip
Section titled “Canonical Clip”Canonical clip 是从 canonical video 中裁出的任务片段。
它通常和某个 benchmark 标注直接关联,例如自然语言查询、手物交互或活动预测。读取标注时要分清 clip_* 时间字段和 video_* 时间字段,避免把 clip 内时间误当成长视频时间。
Capture
Section titled “Capture”Capture 是一次多设备录制会话。
在 Ego-Exo4D 里,一个 capture 可能包含 Aria 和多个 GoPro 同时录下的一整段活动,也可能再切成多个 take。capture 级文件常包含同步信息,例如不同设备之间的时间对齐表。
Take 是从一次 capture 中切出的具体任务片段。
Ego-Exo4D 的许多数据和标注都围绕 take_uid 组织。一个 take 里通常包含同步后的 ego 视频、多个 exo 视频、轨迹、相机标定和任务标注,因此它很适合作为训练和质检的基本单位。
Frame-Aligned Video
Section titled “Frame-Aligned Video”Frame-aligned video 是按帧对齐后的多视角视频。
在 Ego-Exo4D 里,它的目标是让同一个 frame index 在 Aria ego 视角和多个 GoPro exo 视角中对应同一时刻。这样模型或标注工具才能把不同相机看到的同一动作放在一起比较。
ArUco 标记
Section titled “ArUco 标记”ArUco 标记是一种黑白方形视觉标记。
系统可以从图像里检测它的位置和朝向。UMI 里会用它辅助估计桌面参考坐标,也会用夹爪手指上的标记计算夹爪开合宽度。
Replay Buffer
Section titled “Replay Buffer”Replay buffer 是按时间顺序保存 episode 数据的训练数据容器。
在 UMI 这类数据管线里,它会把图像帧、末端位姿、夹爪宽度和 episode 边界整理成模型训练时可以快速采样的格式。
位姿就是“位置 + 朝向”。
只说位置还不够,因为机器不仅要知道自己在房间哪个点,还要知道自己面朝哪里、有没有歪、有没有仰头。
轨迹就是机器一路走过来的路线。
如果把每一时刻的位置连起来,就得到一条轨迹。
漂移就是误差越攒越大。
比如你以为自己沿着走廊直走,但系统估计的位置一点点偏到墙里。刚开始偏一点,跑久了就可能偏很多。
回环就是系统发现“我又回到以前来过的地方了”。
一旦认出来,系统就有机会把之前一路累积的偏差修正掉。比如走了一圈回到门口,系统发现门口和刚开始看到的一样,就能把地图拉得更合理。
关键帧就是“比较值得保存的画面”。
摄像头每秒可能拍很多张图,但每张都保存、都计算会很慢。系统会挑一些代表性画面留下来,就像旅行相册不会把每一秒都放进去。
特征点就是图片里容易再次认出来的小线索。
比如桌角、门框角、墙上海报的角、地砖交叉点。它们比一大片白墙更容易被系统跟踪。
稀疏线索就是“只抓少量关键点”,不试图理解每一个像素。
它的好处是快。坏处是地图通常比较简略,不像完整三维模型那样密。
优化就是“把很多互相矛盾的小证据放在一起,找一个最说得通的结果”。
摄像头可能说往左动了一点,运动传感器可能说转得更快一点。系统要综合它们,选出整体误差最小的解释。
滑动窗口就是“只认真处理最近一小段时间的数据”。
机器一直在走,历史数据会越来越多。为了实时运行,系统常常只拿最近几秒或最近几张关键画面来精算,窗口会随着机器前进不断往前滑。
滤波可以理解成“来一条新信息,就更新一次当前猜测”。
它不一定每次都把全部历史重新算一遍,而是更像持续维护一个当前答案。优点是快,缺点是需要仔细处理误差。

标定就是“把传感器的真实情况量清楚”。
例如摄像头镜头会有变形,运动传感器和摄像头安装时也有相对位置和角度。系统需要知道这些细节,才能把数据对上。
外参标定就是量清楚“两个传感器之间怎么摆放”。
比如摄像头在运动传感器前面几厘米、左边几厘米、转了几度。这个关系如果错了,系统会把运动和画面对歪。
时间同步就是让不同传感器的时间对齐。
摄像头说“这张图是 10:00:00.100 拍的”,运动传感器也要能对应到同一瞬间的运动。如果时间差一点点,高速运动时就会造成明显错误。
TURN(Traversal Using Relays around NAT)是 WebRTC 的中继协议。控制端和机器人端无法通过 NAT 或防火墙直连时,双方都向公网 TURN 服务器建立出站连接,再由它转发加密的媒体和数据通道。
在具身数据采集里,TURN 属于网络连接层:它可以支撑远程视频、机器人状态和遥操作控制到达,但不负责传感器时间同步、相机标定、动作标签或 episode 划分。中继可能增加延迟、抖动、丢包和重连,因此应把连接路径与质量指标写入 session 或 episode 的质量字段。
STUN(Session Traversal Utilities for NAT)帮助设备发现自己在公网 NAT 之后的映射地址。WebRTC 通常先用 STUN 发现可直连的候选路径,失败后再考虑 TURN 中继。STUN 主要发现地址,不负责像 TURN 那样长期转发媒体流。
ICE(Interactive Connectivity Establishment)是 WebRTC 测试和选择连接路径的机制。它会比较本地地址、STUN 得到的公网映射地址和 TURN 中继地址,选择当前可用的路径。对具身数据,最终选中的路径和网络质量应作为采集上下文记录。
双目摄像头就是两个摄像头并排看世界。
它有点像人的两只眼睛:同一个物体在左右眼里位置略有不同,系统可以利用这个差异估计远近。
深度相机不只拍颜色,还能直接给出距离信息。
它能告诉系统“这个点离我大概多远”,所以建三维地图会更直接。但它也有成本、距离范围、户外强光等限制。
语义就是“这是什么东西”。
普通地图可能只知道这里有一片点云或墙面。带语义的地图会进一步知道这是门、地面、桌子、人、车辆等。
三维网格可以理解成用很多小三角片拼出来的立体表面。
它比一堆散点更像真实物体表面,适合显示房间、墙面、桌椅的大概形状。
轨迹评估就是比较“系统估计路线”和“真实路线”的差距。
它不是只看终点差多少,也会看一路上偏了多少、是否越跑越偏、回到旧地方后有没有修正。
Schema / 数据模式
Section titled “Schema / 数据模式”Schema(数据模式)是规定数据对象有哪些字段、类型、单位、坐标系、时间语义和版本的结构约定。具身数据 schema 至少要能解释 observation、action、state、事件、标签来源、episode 边界和质量状态,并明确哪些字段必填、哪些允许缺失;字段名一致不代表数据已经完成时间或空间对齐。
Rollout
Section titled “Rollout”Rollout 是策略在仿真或真实环境中从初始状态执行到结束的一次运行记录。它的输入包括策略版本、任务变体、环境和观测流,输出包括动作、状态变化、事件、成功/失败结果和质量指标;记录还应保存随机种子、设备或仿真版本、时间戳及人工接管,才能用于失败分析和闭环评估。
Split / 数据集划分
Section titled “Split / 数据集划分”Split(数据集划分)是把 episode、任务变体或资产按规则分到训练、验证和评估集合的过程。具身数据应按场景、资产、操作者、机器人和时间等相关性控制泄漏,并保存划分规则与版本;随机按帧切分会让同一轨迹或同一场景同时出现在训练和评估中,导致结果虚高。
WASM(WebAssembly)是一种可在浏览器中高效执行编译代码的运行格式,常用于把 MuJoCo 等仿真或控制逻辑放到采集者的本地页面运行。WASM 输出的观测、请求动作和仿真时钟仍需与浏览器输入、控制映射、环境版本和上传记录绑定;本地运行不自动保证物理正确、网络可靠或轨迹达到数据准入标准。
RGB-D 数据同时包含彩色图像(RGB)和深度图(D),可为具身任务提供外观与距离信息。数据必须说明彩色/深度相机 ID、内外参、分辨率、深度单位、时间同步和无效深度编码;深度空洞、遮挡、视差或彩色与深度未对齐时,应记录质量掩码,不能把缺失值当成真实距离。
Holdout / 留出集
Section titled “Holdout / 留出集”Holdout(留出集)是从训练和调参流程中预先隔离、只在最终或阶段性验收时使用的数据集合。具身数据的留出集应按任务、资产、场景、机器人或时间保留真正未见的组合,并冻结成员清单、标签和评估协议;部署反馈和失败挖掘结果不能未经审计直接回流,否则会破坏留出集的独立性。
Policy Gap / 策略差距分析
Section titled “Policy Gap / 策略差距分析”Policy Gap(策略差距分析)是比较当前策略能力与任务要求、成功轨迹或部署分布之间缺口的分析。输入包括策略 rollout、失败事件、置信度、动作分歧、任务变体覆盖和质量元数据,输出包括可解释的失败簇、覆盖缺口和候选采集目标;差距信号应能回链到评估版本,不能只把低成功率直接当作采样权重。
Data-to-Model
Section titled “Data-to-Model”Data-to-Model 是把合格数据从采集、处理、验证和版本化数据集送入训练、验证与部署反馈的端到端链路。输入包括数据契约、质量结论、授权、split、模型配置和训练清单,输出包括可复现的模型版本、评估结果和部署反馈;训练准入、评估隔离、数据血缘与失败回流必须分别记录,不能用“已训练”代替质量或效果证明。
把任务观测、操作者动作、机器人执行和结果绑定的轨迹记录。
把源本体的动作映射为目标机器人可执行动作的过程。
某时刻控制命令由人、AI 策略或安全控制器产生的标签。
恢复三维对象在连续时间中的几何和运动。
坐标数值具有可核验的实际长度单位。
可动关节状态
Section titled “可动关节状态”门铰链或滑轨等部件相对固定部分的角度或位移。
仿真到真实迁移
Section titled “仿真到真实迁移”在仿真数据上形成的能力转用于真实设备的过程。
仿真与真实在观测、动力学或任务分布上的差异。
建立跨传感器事件的共同时间和坐标关系。
把不同传感器测量转换到同一几何参照的过程。
不同真实状态在当前观测上看起来相似,需借助历史或其他模态区分。
为物体中的可操作组成部分单独分配空间标签。
同一三维点随时间的位置序列。
尺寸和位姿可用实际长度单位解释的三维表示。
通过改变视角或与环境交互,主动获取任务所需信息。
按预定规则决定观测能否支持某个任务结论。
一次观测使目标属性的不确定性减少的程度。
从状态变化学习的动作相关编码,而非直接可执行命令。
把不同机器人或人体动作映射到可比较的共享表示。
机器人末端工具上用于定义位姿与动作的参考点。
把原用途之外的数据经筛选、重标或加权用于新任务。
使训练样本在关键状态、动作和时序属性上更接近目标用途。
训练时控制一条样本贡献大小的显式数值。
策略一次生成、随后逐步执行的一段动作序列。
同时表示三维平移和旋转的刚体位姿空间。
相邻时间或动作块在位置、速度等量上的衔接程度。
给定当前观测或状态及动作,预测后续状态、观测或其压缩表示的模型;训练数据必须说明预测跨度和动作是否真的生效。
世界动作模型
Section titled “世界动作模型”联合表示未来观测与可执行动作的模型,数据中应区分预测视频、动作计划和实际执行。
联合嵌入预测架构,在表征空间预测目标而不必重建每个像素;用于具身数据时仍要检查动作条件和物理一致性。
从同一起点估计未实际执行的候选动作可能造成的后果;真实环境通常无法同时给所有候选提供真值。
从策略所依据的观测到其命令实际生效之间的时间差,异步规划时尤其需要记录。
MPC / 模型预测控制
Section titled “MPC / 模型预测控制”反复根据当前状态预测候选动作的结果、选取近期动作并重新规划的控制方式。
带有时间、地点、任务和结果上下文的过去事件记录,可供机器人在后续任务中检索。
条件视觉指代
Section titled “条件视觉指代”根据当前语言任务和执行阶段确定某个视觉对象或区域具体指什么。
技能执行前必须获得并满足的关键点、法向、接触面或目标位姿等几何接口条件。
策略一次预测一段连续控制命令的执行方式;数据应保存各块的观测依据与生效时间。
任务阶段必须由可观察物理状态满足的条件,可用于判断执行是否偏离并触发纠错。
触觉通常描述接触区域的局部分布或形变,力觉描述力和力矩;二者的采样与标定不能混同。
Taxel / 触觉单元
Section titled “Taxel / 触觉单元”触觉阵列中的一个空间采样单元,记录局部压力或形变并需要对应传感器位置。
物体随接触变化的形状、拓扑或材质属性,需说明哪些部分来自观测、哪些是估计。
在不释放抓持的情况下通过手指协调改变物体相对手掌的位姿。
规划或控制中参与传力的接触部位以及抓持、滑动、释放等状态组合。
步态周期中某只脚保持触地的时间比例,可与滑移和跌倒事件一起评价。
给空间单元同时标注占据或可通行状态与物体类别的三维表示。
某个时间段地图的几何、语义实体和来源证据的状态标识,用于复现导航决策。
尚未碰撞但已满足预设距离、时间或安全裕度阈值的风险事件。
ASR / 自动语音识别
Section titled “ASR / 自动语音识别”把原始语音转换成文本的过程;具身语音控制数据应同时保留语音、转写和机器人实际收到的指令。
反事实配对评估
Section titled “反事实配对评估”固定初态和其他条件,只改变待测因素并成对比较动作或结果的评价方法。
子任务 Q 值
Section titled “子任务 Q 值”在特定子任务下,从给定状态执行某动作后预期获得的累计回报估计。
先满足高优先级目标,再在该目标可行的范围内优化低优先级目标。
在动力学、碰撞和执行器限制内搜索满足任务目标的状态与动作序列。
机器人、环境和接触必须满足的力、速度、几何或动力学边界。
领域扩展字段
Section titled “领域扩展字段”在共享 episode 契约之外,针对行业设备、材料或安全条件增设的数据字段。
LiDAR / 激光雷达
Section titled “LiDAR / 激光雷达”用激光测量周围距离或形状的传感器;数据集需保存扫描时间、坐标和有效范围。