Skip to content

具身智能数据术语表

这页专门解释主文档里不得不用到的词。每个词都尽量降低理解门槛,不要求先有数学或机器人基础。

具身智能数据术语关系示意图

具身智能数据,就是带着“身体”和“环境”的智能数据。

它通常不只是图片或文字,还会包含机器人在哪里、看向哪里、做了什么动作、传感器读到了什么、环境发生了什么变化。和普通网页数据相比,它更强调时间、空间和动作之间的关系。

传感器数据就是设备从真实世界采回来的原始记录。

摄像头给图片,麦克风给声音,运动传感器给晃动和加速度,轮子编码器给轮子转了多少。具身智能系统要把这些零散记录对齐后,才更容易判断“当时到底发生了什么”。

时间戳就是一条数据发生的具体时间。

它像给每张图片、每条传感器读数贴上时间标签。没有时间戳,很多数据就很难拼在一起。

数据对齐就是把不同来源的数据按时间或空间配到一起。

例如某张图像应该对应哪一条运动传感器记录、机器人当时在哪个位置、机械臂当时伸到哪里。对齐错了,后面的训练、标注和评估都会跟着错。

轨迹数据记录的是设备一路怎么走。

它通常包含一串时间、位置和朝向。具身智能里,轨迹数据常用来回放采集过程、训练导航模型、评估定位结果。

标定文件记录传感器的关键参数。

它告诉系统镜头怎么变形、传感器之间怎么安装、数据该怎么换算。标定文件用错,就像戴着度数不合适的眼镜看世界。

SLAM 是“同时定位和建图”的缩写。也就是机器一边走,一边回答两个问题:

  • 我现在大概在哪里?
  • 我走过的地方大概长什么样?

扫地机器人、无人机、AR 眼镜、自动驾驶小车都会遇到这类问题。

“视觉”是摄像头看到的画面。“惯性”是运动传感器感到的转动、加速和晃动。

视觉惯性就是把“看见了什么”和“身体怎么晃了”合在一起判断运动。

IMU 是一个常见缩写,可以先理解成“运动传感器小盒子”。

它通常能测两类东西:

  • 设备转得有多快。
  • 设备加速或减速得有多明显。

手机横竖屏切换、手柄体感、无人机稳定飞行,都离不开这类传感器。

VIO 可以理解成“视觉惯性定位”。

它主要关心“我怎么移动了”,不一定负责长期保存和维护完整地图。SLAM 则更强调“定位”和“建图”一起做。

Ego 视角就是第一人称或本体视角。

在具身智能数据里,它通常表示相机跟着执行者移动:人戴着眼镜、机器人头部相机看世界,或像 UMI 那样把相机装在手持夹爪上。它记录的是“执行者当时能看到什么”,适合学习操作过程中的接触、遮挡和物体状态变化。

世界模式就是把采集到的数据放回一个较稳定的环境坐标系里。

例如用 SLAM 地图、桌面标记板或房间坐标系来描述相机和夹爪在哪里。它关心环境、地图、位姿和坐标对齐,方便比较不同演示和不同设备采集的数据。

操作模式就是数据怎样表达“下一步怎么动”。

它可以是绝对末端位姿、相对当前位姿的未来轨迹,也可以是每个控制周期的小增量。对模仿学习来说,操作模式会直接影响模型学到的动作是否容易跨场景、跨机器人复用。

UMI 是 Universal Manipulation Interface 的缩写,可以理解成一种手持夹爪式操作数据采集框架。

它把 GoPro 摄像头、IMU、夹爪标记和后处理管线结合起来,让人在真实场景中用夹爪演示任务,再把视频处理成机器人策略可以学习的图像、末端轨迹和夹爪宽度数据。

ArUco 标记是一种黑白方形视觉标记。

系统可以从图像里检测它的位置和朝向。UMI 里会用它辅助估计桌面参考坐标,也会用夹爪手指上的标记计算夹爪开合宽度。

Replay buffer 是按时间顺序保存 episode 数据的训练数据容器。

在 UMI 这类数据管线里,它会把图像帧、末端位姿、夹爪宽度和 episode 边界整理成模型训练时可以快速采样的格式。

位姿就是“位置 + 朝向”。

只说位置还不够,因为机器不仅要知道自己在房间哪个点,还要知道自己面朝哪里、有没有歪、有没有仰头。

轨迹就是机器一路走过来的路线。

如果把每一时刻的位置连起来,就得到一条轨迹。

漂移就是误差越攒越大。

比如你以为自己沿着走廊直走,但系统估计的位置一点点偏到墙里。刚开始偏一点,跑久了就可能偏很多。

回环就是系统发现“我又回到以前来过的地方了”。

一旦认出来,系统就有机会把之前一路累积的偏差修正掉。比如走了一圈回到门口,系统发现门口和刚开始看到的一样,就能把地图拉得更合理。

关键帧就是“比较值得保存的画面”。

摄像头每秒可能拍很多张图,但每张都保存、都计算会很慢。系统会挑一些代表性画面留下来,就像旅行相册不会把每一秒都放进去。

特征点就是图片里容易再次认出来的小线索。

比如桌角、门框角、墙上海报的角、地砖交叉点。它们比一大片白墙更容易被系统跟踪。

稀疏线索就是“只抓少量关键点”,不试图理解每一个像素。

它的好处是快。坏处是地图通常比较简略,不像完整三维模型那样密。

优化就是“把很多互相矛盾的小证据放在一起,找一个最说得通的结果”。

摄像头可能说往左动了一点,运动传感器可能说转得更快一点。系统要综合它们,选出整体误差最小的解释。

滑动窗口就是“只认真处理最近一小段时间的数据”。

机器一直在走,历史数据会越来越多。为了实时运行,系统常常只拿最近几秒或最近几张关键画面来精算,窗口会随着机器前进不断往前滑。

滤波可以理解成“来一条新信息,就更新一次当前猜测”。

它不一定每次都把全部历史重新算一遍,而是更像持续维护一个当前答案。优点是快,缺点是需要仔细处理误差。

传感器对齐与标定示意图

标定就是“把传感器的真实情况量清楚”。

例如摄像头镜头会有变形,运动传感器和摄像头安装时也有相对位置和角度。系统需要知道这些细节,才能把数据对上。

外参标定就是量清楚“两个传感器之间怎么摆放”。

比如摄像头在运动传感器前面几厘米、左边几厘米、转了几度。这个关系如果错了,系统会把运动和画面对歪。

时间同步就是让不同传感器的时间对齐。

摄像头说“这张图是 10:00:00.100 拍的”,运动传感器也要能对应到同一瞬间的运动。如果时间差一点点,高速运动时就会造成明显错误。

双目摄像头就是两个摄像头并排看世界。

它有点像人的两只眼睛:同一个物体在左右眼里位置略有不同,系统可以利用这个差异估计远近。

深度相机不只拍颜色,还能直接给出距离信息。

它能告诉系统“这个点离我大概多远”,所以建三维地图会更直接。但它也有成本、距离范围、户外强光等限制。

语义就是“这是什么东西”。

普通地图可能只知道这里有一片点云或墙面。带语义的地图会进一步知道这是门、地面、桌子、人、车辆等。

三维网格可以理解成用很多小三角片拼出来的立体表面。

它比一堆散点更像真实物体表面,适合显示房间、墙面、桌椅的大概形状。

轨迹评估就是比较“系统估计路线”和“真实路线”的差距。

它不是只看终点差多少,也会看一路上偏了多少、是否越跑越偏、回到旧地方后有没有修正。