Skip to content

VLA 模型与主流验证方法

VLA(Vision-Language-Action)模型把视觉观测、语言指令和机器人状态映射为动作。它不是“看图后给一句答案”,而是要在时间连续、动作会改变环境的闭环里完成任务。因此,验证 VLA 不能只看离线预测分数,还要检查数据是否对齐、动作是否可执行、任务是否成功,以及换场景和换机器人后是否仍然安全。

VLM 与 VLA 协作完成具身任务的闭环:高层模型规划,VLA 输出动作,执行结果回流

VLM(Vision-Language Model)接收图像、视频和语言,输出描述、空间关系、目标位置、任务计划或工具调用。它通常不直接承担每个控制周期的关节动作,而是回答“目标是什么、下一步做什么、是否需要重新规划”。在具身场景中,VLM 的输出也必须带有坐标系、置信度、有效时间和工具调用结果。

VLA 接收视觉和语言,也可以接收关节状态、末端位姿等本体感觉信息,输出关节命令、末端位姿、夹爪动作或一段 action chunk。它更接近控制回路,必须明确动作表示、频率、延迟、预测窗口、坐标系和停止条件。

复杂任务通常把 VLM 的长程推理与 VLA 的短程执行组合起来:高层模型把“整理桌面”拆成多个子任务,VLA 执行每个子任务,环境反馈再决定继续、修正或停止。这里的接口本身就是数据契约,不能只传一段自然语言而不记录目标、状态和完成条件。

Google DeepMind 的 Gemini Robotics 1.5 是一个清晰的分层案例:

  • Gemini Robotics-ER 1.5(VLM / embodied reasoning):负责理解物理世界、空间推理、进度估计、工具调用和多步规划;官方介绍还提到它可调用搜索或用户定义函数。
  • Gemini Robotics 1.5(VLA):把视觉信息和分步语言指令转换为机器人动作,并在动作前进行更深的任务分析;它还强调跨 ALOHA 2、Franka 双臂和 Apollo 人形机器人迁移。
  • 组合方式:ER 1.5 作为高层编排器,把任务拆成子目标;VLA 负责具体动作;执行结果、环境变化和任务进度回流,触发继续执行或重新规划。

这套实践对数据项目的启发是:高层计划和低层动作应分开存储,但必须共享 episode_id、step_id、时间戳、子任务边界和完成判定。这样既能单独评测 VLM 的空间理解,也能单独评测 VLA 的控制质量,还能评测组合后的长任务成功率。

VLA 验证从数据契约、离线动作预测逐步升级到真实闭环、泛化与安全

这是最先做、也最容易被忽略的一层。每个样本至少应绑定:任务指令、场景和机器人 ID、RGB / 深度、本体状态、动作类型、控制频率、观测与动作延迟、episode 边界、成功或失败原因、标定版本和质检状态。

检查重点包括:

  • 图像、状态和动作是否在同一时间域,动作是对当前帧还是未来帧生效。
  • 位姿的坐标系、单位、旋转表示和夹爪正负方向是否明确。
  • 训练、验证和测试是否按 episode、场景、物体或机器人隔离,避免同一演示泄漏。
  • 原始观测、派生标签、人工审核结果和模型输出是否可追溯到版本。

VLA episode 将语言任务、观测、动作、结果和质量字段绑定到同一时间链

离线评测不让模型真正控制机器人,而是用留出的演示或回放检查模型在给定观测下预测动作的能力。常见指标包括动作均方误差、位置 / 旋转误差、夹爪状态准确率、负对数似然、动作分布校准,以及在不同任务和物体上的分层统计。

它适合做快速回归、数据清洗和模型消融,但不能直接等价于任务成功率:一个动作与示范不完全相同,仍可能完成任务;反过来,平均动作误差小,也可能在接触、抓取或避障时失败。

在 Isaac Lab、Isaac Sim 或其他仿真环境中让策略真正执行动作,统计任务成功、完成进度、碰撞、超时、重置次数和动作延迟。仿真适合批量覆盖初始位姿、物体类别、光照、遮挡和控制扰动,也适合利用仿真真值自动生成失败原因。

回放评测则把动作送入记录好的环境或离线动力学模型,成本低于真实机器人,但要明确它不是完整闭环:环境不会因为模型动作而真实改变时,接触和恢复能力无法被充分验证。

真实验证应按固定任务协议运行,而不是只展示少数成功视频。建议记录每次尝试的完整 episode,并报告:任务成功率、平均完成时间、有效动作比例、重规划次数、人工接管率、碰撞 / 近碰撞、安全停止、传感器丢失和失败原因。

测试集应至少包含已见任务、已见物体的新布局、未见物体、语言改写、遮挡或轻微扰动、恢复任务,以及不同操作者或不同时间段。成功率需要带样本数和置信区间,避免只比较一个百分比。

如果模型声称具有通用性,应把“训练本体”和“测试本体”分开,检查动作接口、相机视角、自由度、夹爪形态和控制频率变化下的性能。跨本体评测不能只看任务是否成功,还要检查动作是否违反关节限制、是否需要额外的本体适配,以及失败是否集中在某一类形态。

跨分布还包括新场景、新物体、新指令、新光照、新背景和传感器扰动。报告时建议分别列出 seen / unseen,而不是混成一个总平均值。

安全验证至少分成两层:低层的碰撞、力矩、速度、关节和稳定性约束;高层的语义安全,例如是否理解“不要碰触人”“先等待确认”“物体掉落后停止并报告”。ASIMOV benchmark 是 DeepMind 公开介绍的语义安全评测方向之一;工程上仍应把安全控制器、急停和人工接管作为独立防线,不能把语言模型的判断当作唯一保护。

可以先建立一个可复用的 6 组任务集:

  1. 基础成功:已见任务、已见物体、固定布局,检查数据和控制链路是否通。
  2. 布局泛化:改变物体位置、朝向和数量,检查视觉到动作的空间泛化。
  3. 语义泛化:改写指令、增加约束或改变任务顺序,检查高层理解。
  4. 扰动恢复:移走物体、遮挡相机、让物体滑落,检查闭环反馈和重规划。
  5. 跨本体:换相机、夹爪、机械臂或控制频率,检查接口与迁移能力。
  6. 安全边界:加入人手、易碎物、禁区和异常动作,检查安全停止与人工接管。

每组任务都保存原始视频、状态、动作、模型版本、提示词或计划、控制器版本、执行日志和失败标签。最终结果按任务组、场景、物体、机器人和失败类型切分,而不是只给一个总成功率。

VLA 的验证应沿着“数据可重放 → 动作可预测 → 闭环能完成 → 换分布仍泛化 → 风险可控”逐级推进;Google DeepMind 的 VLM + VLA 分层实践说明,高层 embodied reasoning 与低层动作策略可以协同,但评测和数据追溯也必须按这两个角色分别建模。