Skip to content

具身数据质量与基准评估

具身基准是一套可复现的数据、任务、执行协议和评分规则,不只是任务清单。相同模型在不同场景构成、示教预算或部署接口下的成绩可能不可比。H2RBench针对人到机器人迁移统一真实人体视频与仿真机器人演示的比较设置;REAL-I 经验总结则指出离线动作预测指标难以预示闭环成功。评估设计应从数据契约开始。

具身基准从任务意图、数据工件、执行协议到审计结果的构建流程

先定义任务初态、允许操作、目标谓词、时间/碰撞限制、终止条件和可观测证据。每个 episode 保存场景版本、物体实例、指令、策略版本、随机种子、执行日志与评分器版本。Embodied-BenchForge强调基准构建中间工件的依赖与逐项核验;因此场景生成、标注、脚本和评分器要分别有版本与校验结果。

对长时任务,记录子技能进入、完成、失败和重试事件。Behavior-Skill做细粒度技能评价;EmbodiedMemory-Bench要求智能体从交互历史更新记忆,再在后续任务中使用。两类基准都需要保存阶段间状态,而不只报最终成功。

基准评估包中任务版本、原始观测、过程事件与评分证据的关系

对象 建议字段 复现检查
任务定义 task_spec_id, initial_state, goal_predicates, termination_rules 目标是否可由观测或独立测量判定
数据来源 scene_id, object_ids, demo_source, annotation_version, license 训练与测试是否共享原始轨迹或派生样本
执行过程 episode_id, policy_hash, seed, observation_log, action_log, events 失败可否逐步回放
分数与证据 metric_version, success, stage_scores, failure_cause, review_status 自动评分与人工复核有无冲突

具身评估从感知、语义、动作和环境四个层次追溯失败

评估至少分开四类错误:感知或定位错误、语义理解正确但动作未随之改变、动作可行却控制失败,以及环境或评分器缺陷。STAGE用固定观测、仅改变指令语义的反事实样本检验语义是否真正进入动作;IMPACT-VLA利用反事实轨迹做多模态归因。反事实成对样本必须除测试变量外保持观测、初态和控制条件一致。

只汇总平均成功率会隐藏脆弱点。按任务阶段、物体、场景、视觉条件和干扰组合切片;复合鲁棒性配对评估提示单轴扰动得分不能代替组合条件。RoboSPA关注复杂场景和长时任务,Bench2Dex关注跨灵巧手的视觉触觉双臂操作,Neverwhere关注视觉跑酷;综合报告要保留各自测试轴。

划分数据时按原始场景、物体实例、人体视频、演示者和任务组合成组,所有增强及转码版本跟随原样本。报告示教数量、机器人监督量、超参数搜索预算和置信区间。JumpStart的大规模实验显示算法排名受调参与基准组成影响;因此公开选择协议,避免只展示最优检查点。对世界模型、仿真器和视觉检索,分别核对预测校准 PAWBench、神经肌肉行为与动作外观差异 肌肉驱动仿真保真度、以及检索规则与经验库质量 视觉经验检索审计。

本页索引收录 2026-08-27 至 2026-09-27 发表、归入本主题的论文。