模型条件化数据引擎
模型条件化数据引擎(model-conditioned data engine)把模型评估结果变成下一轮数据生产的输入。它不把“更难”或“成功率更低”直接当作数据价值,而是结合失败原因、置信度、分布漂移、物理违规和采集成本,选择最能改善模型的任务变体。
对具身 AI 数据而言,引擎的输入是程序化任务、策略评估、数据质量和部署反馈的标准化元数据;输出是带任务参数、采样权重、来源、版本、质量结论和评估用途的候选任务队列。每次选择都要能回答:模型在哪里失败、失败是否可归因、需要采集什么观测与动作、数据将进入哪个 split,以及它是否真的改变了后续评测。
一、从评估信号到采样优先级
Section titled “一、从评估信号到采样优先级”1. 先统一评估事件
Section titled “1. 先统一评估事件”每次 rollout 或回放都应保存可关联的事件记录,而不只是一个成功布尔值。最小字段包括:episode_id、task_id、task_variant_id、策略与数据集版本、场景和机器人版本、随机种子、观测与动作时间戳、成功状态、失败原因、置信度、分布标签、物理事件、质量状态和评估 split。
失败原因应同时保留原始事件和聚类结果。例如 grasp_slip、occlusion、timeout、collision_near_miss、out_of_distribution 可以作为稳定的原子标签,聚类版本再把它们组织成“接触不稳定”“视觉遮挡”“长程规划”等可用于搜索的模式。模型生成的解释只能作为辅助字段,不能替代传感器、控制器和人工审核证据。
2. 用多信号计算优先级
Section titled “2. 用多信号计算优先级”可以先用透明的规则或线性模型建立候选排序。对任务变体 v,一个可解释的优先级形式是:
priority(v) = failure_value(v) × uncertainty(v) × drift(v) + violation_risk(v) + coverage_gap(v) - collection_cost(v)各项都应在任务、失败簇和时间窗口内分层统计,再进行归一化:
- 失败价值:看失败频率、对任务完成度的影响和是否能覆盖重要恢复状态;同样的失败率,在关键安全步骤上价值更高。
- 不确定性:结合策略置信度、校准误差、动作分歧和重复回放的一致性。低置信度不一定是失败,但通常值得做针对性验证。
- 分布漂移:比较训练数据与当前 rollout 的视觉、状态、动作和任务参数分布。漂移大的任务可能需要真实采集校准,而不是继续增加仿真数量。
- 物理违规风险:记录碰撞、穿透、关节越界、速度或力矩超限、滑落和安全停止。任务成功也不能抵消可执行性或安全风险。
- 覆盖缺口:识别任务、物体、布局、机器人、光照、延迟和恢复阶段的长尾空洞,避免只围绕当前最常见失败过采样。
- 采集成本:估计仿真计算、人工时长、设备占用、失败风险和质检成本,并保留成本版本,便于解释预算取舍。
不要把单一成功率直接映射成权重:它会把任务难度、标签质量、场景比例和安全风险混在一起。也不要把“困难”作为永久标签;当策略更新或数据分布变化时,任务的边际价值也会变化。排序结果应保留每个信号的贡献和阈值,支持审计与回归。
优先级到采样权重的转换必须固定配置并可重算。对同一轮、同一目标切片内的全部合格候选,先使用正值变换 u(v) = exp(priority(v) / temperature),再按该队列批次归一化到均值 1:w_raw(v) = u(v) / mean(u);最后裁剪到 [0.25, 4.0],因此任何合格候选的最小权重都是 0.25,不会因优先级偏低而彻底失去覆盖。一个可复现配置是 temperature=1.0、clip_min=0.25、clip_max=4.0、normalization_scope=round × target_slice、min_weight=0.25;发布队列时同时保存优先级、配置、候选集合哈希和归一化分母。若某切片没有合格候选,则不生成权重并由数据引擎负责人退回任务约束审核,不用默认值静默补齐。
3. 从任务价值生成候选队列
Section titled “3. 从任务价值生成候选队列”任务选择器消费任务规格和评估元数据,产生一批可执行候选,而不是直接修改训练集:
- 按失败簇、漂移簇和覆盖缺口确定目标切片,并锁定需要保持隔离的评估切片。
- 在可达性、碰撞、支撑面、动作空间和安全约束内搜索任务参数,例如物体位姿、遮挡程度、目标距离、摩擦、光照、控制延迟和初始状态。
- 对候选做去重、配额和多样性约束,限制同一场景、同一资产、同一策略版本或同一操作者的占比。
- 根据证据选择采集来源:可自动验证的覆盖缺口优先进入仿真;需要传感器噪声、接触和恢复行为的任务进入真实或人类采集。
- 写入候选队列版本、原因、预计产量、采集方式、目标 split 和停止条件,等待生成与验收。
这样,任务选择和数据准入保持分离:队列负责“值得采什么”,质量门负责“采到的样本能否使用”。
二、输入、输出与时间—空间对齐
Section titled “二、输入、输出与时间—空间对齐”引擎至少接收四类元数据:
| 输入 | 关键字段 | 用途 |
|---|---|---|
| 程序化任务 | 任务规格、场景、资产、本体、随机化范围、成功条件 | 定义可搜索的任务空间 |
| 策略评估 | 策略版本、rollout、成功状态、失败簇、置信度、动作分歧 | 定位模型弱点 |
| 数据质量 | 完整性、时间同步、坐标系、传感器、物理和授权状态 | 防止低质量信号污染排序 |
| 部署反馈 | 设备、软件、环境、人工接管、安全事件、现场分布 | 校准仿真与真实分布 |
这些对象应通过 task_variant_id、episode_id、policy_version 和 dataset_version 连接,不能只靠文件名或目录推断关系。
输出数据契约
Section titled “输出数据契约”候选任务和生成 episode 的输出应包含:参数快照及哈希、生成器和资产版本、策略版本、采样原因与权重、来源(仿真/真实/人类)、观测、动作、状态、事件、标签、质量结果、血缘、授权和 split。原始观测、派生标签、策略动作、人类动作和安全控制器动作要分别记录 source,避免下游把不同来源误当成同一种监督信号。
时间对齐要记录采样时间、设备时间、动作计划时间和实际生效时间,明确观测对应当前动作还是未来动作。空间对齐要记录世界、机器人基座、末端、相机和物体坐标系、单位、外参与标定版本。重采样、插值、延迟补偿和丢帧都要留下方法与误差;发现无法解释的对齐异常时,标记为 excluded,不要静默修正。
三、六阶段数据引擎飞轮
Section titled “三、六阶段数据引擎飞轮”1. 任务生成
Section titled “1. 任务生成”输入是版本化任务规格、资产、机器人本体和上一轮评估信号;输出是带 seed、参数快照、约束检查和候选原因的任务实例。生成器应报告拒绝率与实际参数分布,避免声明的随机化范围和最终数据分布不一致。
2. 数据采集
Section titled “2. 数据采集”输入是任务实例和采集协议;输出是原始视频、传感器、状态、动作、事件和环境快照。仿真数据要区分观测与真值,真实数据要记录设备、操作者、软件、标定和安全事件;两者都要保留 episode 边界和时钟来源。
3. 验证与质量控制
Section titled “3. 验证与质量控制”输入是原始 episode;输出是质量报告、标签版本、对齐误差、物理检查、回放状态和准入结论。质量状态与任务成功状态分开:成功但丢帧的 episode 不能作为高质量训练样本,失败但能解释恢复策略的 episode 可以进入失败分析或恢复训练。
4. 训练与评估
Section titled “4. 训练与评估”输入是按规则构建的数据集快照;输出是模型版本、训练配置、指标、失败聚类和评估日志。训练、验证和测试按 episode、场景、资产、任务模板、机器人和时间段隔离,且要在聚合前锁定划分键,防止同一原始轨迹的相邻窗口泄漏。
输入是通过隔离评估的策略和安全配置;输出是现场 rollout、延迟、人工接管、碰撞/近碰撞、传感器异常、任务结果和环境分布。部署反馈既是模型信号,也是数据分布信号,必须和部署软件及硬件版本绑定。
输入是现场事件、开发回放差距和数据覆盖报告;输出是新的失败簇、任务参数搜索空间、采样权重和下一轮队列。反馈先写入可追加、可修订的“开发反馈日志”(post-evaluation/development feedback log),每次修订保留作者、时间、理由和上游证据,再经审核、去重、质量检查和 split 分配后成为新数据版本。官方评估集及其正式结果日志始终保持不可变,并且从不作为自适应采样、任务搜索或训练的数据输入;开发反馈只能引用其聚合结论或独立开发回放证据。
四、数据治理与评估隔离
Section titled “四、数据治理与评估隔离”版本化与数据血缘
Section titled “版本化与数据血缘”任务规格、生成器、资产、本体、标定、策略、采集软件、标签器、质量规则和数据集清单都需要独立版本或内容哈希。推荐保留如下血缘链:
policy_vN + eval_log_vN → failure_clusters_vN → candidate_queue_vN → raw_episode_vN+1 → qc_report_vN+1 + replay_status → dataset_snapshot_vN+1 → policy_vN+1数据集清单应能从任意训练样本回到原始文件、任务参数、策略 rollout、评估事件和质量结论,也能反向找到它影响过的模型版本。派生字段不覆盖原始字段,规则更新产生新质量报告和新快照。
分布监控与重加权
Section titled “分布监控与重加权”按任务、物体、布局、视觉条件、本体、失败簇、动作来源和采集来源监控数量与指标。比较训练、留出评估和部署分布时,同时报告样本量、缺失字段和置信区间;小样本不应被伪装成稳定趋势。重加权应有上限、平滑和最小覆盖约束,防止一个高频失败簇吞噬基础能力数据。
训练/评测隔离
Section titled “训练/评测隔离”评估集在任务队列生成前冻结,候选搜索只能读取聚合统计,不能读取评估 episode 的动作或标签。新任务若依据评估失败生成,必须进入后续轮次的训练或开发集,并保留“由哪一评估切片触发”的记录;要测泛化时,使用未参与搜索的任务、资产、场景、操作者或时间段。
重放验证与停止规则
Section titled “重放验证与停止规则”每轮至少重放固定基线集和新增失败簇,检查任务结果、动作可执行性、延迟、坐标和安全事件。若回放环境、仿真器或控制器变更,不能把结果当作同一协议的回归,应新建协议版本。
停止规则应在队列生成前写入队列版本,并由数据引擎负责人执行、评估负责人复核;安全或合规触发项还需质量负责人共同签字。固定规则为:每轮至少完成每个目标切片 n=500 个有效 episode;在未达到该样本数前不得因“无改善”停止。达到样本数后,用固定 holdout 的双侧 95% bootstrap 置信区间比较本轮与基线,只有改善点估计至少 +1.0 个百分点且区间下界仍大于 0 才算有效改善;连续 3 个完成轮次没有有效改善时,停止该目标切片的采集(patience=3)。此外,覆盖率达到队列声明的目标、质量拒绝率超过 10%、对齐误差超过协议上限、任一物理违规/安全事件达到预设红线,或成本达到预算上限时立即停止并升级复核。负责人记录停止原因、统计输入和审批结果;停止采集不等于删除数据,原始失败仍应保留用于审计和后续问题定义。
五、参考协议与资料
Section titled “五、参考协议与资料”- DAgger: Algorithmic and Dataset Aggregation:Ross、Gordon 和 Bagnell 提出通过策略访问状态并由专家提供动作,缓解行为克隆中的分布偏移;在本引擎中对应“失败状态进入采集队列”,不等于无条件复制全部 rollout。
- VLA 模型与主流验证方法:参考数据契约、离线动作预测、仿真闭环、真实闭环、跨本体和安全评估的分层方法。
- 程序化任务生成与具身数据:参考任务规格、随机化、episode 契约、约束检查和 split 隔离。
- 仿真器与具身数据:理解仿真规模、传感器真值、版本耦合和 sim-to-real 对照的边界。
- Open X-Embodiment:跨本体数据和统一接口的资料入口,可用于检查多机器人数据的字段与评估边界。
- SIMPLER benchmark:面向机器人策略的仿真评估环境,适合做闭环回归,但不能替代真实硬件验证。
模型条件化数据引擎的核心不是“让失败样本变多”,而是把可归因的失败、置信度、分布缺口、物理风险和部署反馈转成受约束的任务选择;每个阶段都保留输入、输出、时间—空间对齐、质量结论、评估隔离和版本血缘,下一轮数据才真正可解释、可复现、可用于改进模型。