Open X-Embodiment
22 种机器人形态,强调跨数据集、跨具身的规模与泛化。
REAL-WORLD ROBOT DATA
从一条真机轨迹,到可训练、可评测、可持续回流的数据基础设施
一条可训练的机器人轨迹,究竟必须包含什么?
我们如何证明它在时间、空间与任务结果上可信?
它如何进入训练、评测,并把失败再次送回数据队列?
这不是“拍了多少小时视频”的问题,而是:能否还原一次完整、可对齐、可追责的物理事件。
22 种机器人形态,强调跨数据集、跨具身的规模与泛化。
真实环境、分布式采集,强调场景与操作者的多样性。
便携式人类示范采集,探索低门槛采集与真机策略迁移。
将人类视频、真机、仿真与合成数据放进异构训练混合物。
规模、多样性、动作可观测性与物理可信度,是四个不同的工程轴。
为什么还不够:这些公共数据集解决了规模和多样性,但无法替代我们对时间同步精度、空间标定一致性和失败案例完整性的工程控制,这正是自建采集系统存在的原因。
| 数据形态 | 动作可观测 | 接触与本体 | 优势 | 主要缺口 |
|---|---|---|---|---|
| 互联网 / 人类视频 | 弱 | 弱 | 规模大、语义丰富 | 缺少可执行动作 |
| UMI / 第一视角示范 | 中 | 部分 | 便携、可进真实场景 | 需完成具身映射 |
| 仿真 / 世界模型 | 强 | 可控近似 | 低风险、覆盖长尾 | 存在现实差异 |
| 真机遥操作轨迹 | 强 | 强 | 动作与物理结果同源 | 成本与治理复杂 |
判断原则:不存在普适排序。要看任务是否依赖精细接触、动作可逆性、具身约束与部署环境。
我们的工程策略:以真机遥操作轨迹为核心监督信号,仿真与世界模型用于扩展覆盖和探索失败分支。
真实部署场景把货架、行人、遮挡和操作规则同时带进数据问题
通过世界基础模型与数据处理框架,服务物理 AI 的合成数据生成、预测和评估。
公开来源:NVIDIA Research,2025
探索大规模世界模型对多样环境与交互未来的生成能力。
公开来源:Google DeepMind,2024
生成更多环境、初始状态与失败分支。
真机数据用于确认感知、动作与接触偏差。
部署成功率仍需回到真实机器人上测量。
我们的工程判断:生成经验负责扩覆盖,真机轨迹负责校准与验收,二者不是替代关系。
不是把字段堆在一起,而是让观察、动作、接触、任务阶段和结果共享同一时间线,并能在之后重放、筛选、训练与评测。
6 路相机硬件同步,让视觉、遥控指令与 500Hz 关节力控反馈落在可对齐的时间基准上。
测试口径:同步控制器主时钟到各硬件触发端的通道间偏差。数值沿用 BP3 已披露工程口径;测试仪器、负载和样本量尚未形成公开复现报告。


把相机坐标、机器人基座坐标、末端执行器坐标与任务物体坐标连成可追溯的变换链。
动作表示是否可复现,取决于坐标系定义、标定版本和漂移检测,而不只是模型输出格式。
测试口径:末端执行器对精密校准网格目标点执行多点触碰,比较目标点与校准后实际触点的绝对残差。数值沿用 BP3 图示口径,未作独立审计声明。


| 指标 | 测量边界 | 测试口径 / 当前公开限制 | 对数据的影响 |
|---|---|---|---|
| <100ms 灵御内部实测 | 图像传输延迟 | 从相机曝光链路开始到操作端显示完成;包含编码、网络、解码与显示。公开版暂不列网络条件分布。 | 决定操作者感知与纠错时机 |
| <30ms 灵御内部实测 | 本地控制延迟 | 从本地动作输入采集到机器人控制接口接收;不与图像链路合并计算。 | 决定意图和执行动作的时序一致性 |
| 10μs 灵御内部实测 | 底层控制周期 | 逆解 / 底层控制计算周期的 BP3 工程配置口径;不是端到端遥操作延迟。 | 决定高频反馈可用性 |
| 0-10N 灵御内部实测 | 关节力控范围 | 当前系统公开的力控工作范围;机器人型号、关节与负载条件需在复现报告中逐项列出。 | 支持接触事件与安全边界记录 |
| 250+ 灵御内部实测 | 条 / 小时 | 按已验收轨迹或原子动作计数的小时吞吐;任务复杂度不同,不直接换算为等量训练价值。 | 决定数据回流速度 |


视频加载失败时的场景参考图
任务:目标物、动作边界、结束条件
扰动:行人、遮挡、陈列变化、网络波动
失败 / 干预:停顿、重试、接管、恢复片段
成功标准:物理结果,而非“视频看起来完成”
把“做什么”变成可验收协议。
让意图、执行与结果同源。
把连续流变成可查询片段。
对齐、标定、结果逐项过门。
面向模型栈输出稳定接口。
多相机、本体、动作、力与任务事件接入;统一时钟与轨迹 ID。
操作输入、控制映射、接管与恢复事件作为一等数据记录。
完整性检查、异常检测、任务分段、结果与失败原因标注。
数据清单、标定版本、许可范围、派生数据与模型血缘追踪。
面向 ACT、Pi0、VLA 等不同模型栈提供显式 schema 映射。
仿真筛选、真机评测、错误归因、困难样本与再采集优先级。
架构价值不在“按钮更少”,而在每次训练结果都能追溯到数据与采集条件。
原则:门槛必须产生结构化拒绝原因,否则“删除坏样本”只会把系统问题藏起来。
REJECTED SAMPLE / QG-TIME-04
现象:画面中的抓取接触先于记录动作发生。
风险:模型会把错误状态当作动作前提。
处置:从训练集隔离;保留为采集链路回归测试;检查网络缓冲与时钟重同步事件。
模型在给定数据与损失函数上学到了什么?
它在独立场景中做成了什么,为什么失败,下一条数据该采什么?
作为一身多脑的数据平台,我们不需要假装已经解决所有开放问题。需要回答的是:哪些属于平台责任,当前走到哪一步,哪些仍然是研究问题。下面的“当前方向”是现有架构与数据流程的公开边界,不等同于已完成的产品能力。
视频、状态、动作、接触和结果必须共享可追溯的时间与空间基准。
同步、标定、任务协议和干预记录,无法只靠后期清洗补齐。
每次真机失败都应该能回到数据队列,成为下一轮采集优先级。
SCHEMA
最小轨迹字段与事件词表
REPORT
同步 / 标定测试报告格式
BENCHMARK
失败、干预与恢复的评测协议
GOVERNANCE
真实部署数据的脱敏与许可清单
本次公开:演示稿、脱敏轨迹字段与事件词表片段,以及质量门示例。未承诺尚未准备好的数据集或代码仓库。
时间同步、空间定位、图像传输、本地控制、底层控制、力控范围与小时吞吐,均来自灵御现有 BP3 工程材料。
本稿已注明测试口径及公开限制;这些数字不表示独立第三方认证。后续公开复现时应补充设备、负载、网络条件、样本量和统计分布。