灵御智能实验环境中的多台机器人与操作人员
TECH COMMUNITY30-40 MIN · 18 SLIDES

REAL-WORLD ROBOT DATA

真实世界经验,
如何成为机器人可学习的数据

从一条真机轨迹,到可训练、可评测、可持续回流的数据基础设施

金戈 · 灵御智能技术社区分享2026.07darkthree.com/speech2/

FRAME

先把“机器人数据”问具体

一条轨迹 · 三次追问
01

一条可训练的机器人轨迹,究竟必须包含什么?

02

我们如何证明它在时间、空间与任务结果上可信?

03

它如何进入训练、评测,并把失败再次送回数据队列?

这不是“拍了多少小时视频”的问题,而是:能否还原一次完整、可对齐、可追责的物理事件。

PUBLIC LANDSCAPE

同样叫“数据”,解决的是不同问题

外部数据:一手公开来源
1M+

Open X-Embodiment

22 种机器人形态,强调跨数据集、跨具身的规模与泛化。

76k / 350h

DROID

真实环境、分布式采集,强调场景与操作者的多样性。

IN-THE-WILD

UMI

便携式人类示范采集,探索低门槛采集与真机策略迁移。

MIXTURE

GR00T N1

将人类视频、真机、仿真与合成数据放进异构训练混合物。

规模、多样性、动作可观测性与物理可信度,是四个不同的工程轴。

为什么还不够:这些公共数据集解决了规模和多样性,但无法替代我们对时间同步精度、空间标定一致性和失败案例完整性的工程控制,这正是自建采集系统存在的原因。

DATA FORMS

视频不是轨迹,轨迹也不是唯一答案

数据形态动作可观测接触与本体优势主要缺口
互联网 / 人类视频规模大、语义丰富缺少可执行动作
UMI / 第一视角示范部分便携、可进真实场景需完成具身映射
仿真 / 世界模型可控近似低风险、覆盖长尾存在现实差异
真机遥操作轨迹动作与物理结果同源成本与治理复杂

判断原则:不存在普适排序。要看任务是否依赖精细接触、动作可逆性、具身约束与部署环境。

灵御的选择

我们的工程策略:以真机遥操作轨迹为核心监督信号,仿真与世界模型用于扩展覆盖和探索失败分支。

药房场景中的机器人部署仿真画面

真实部署场景把货架、行人、遮挡和操作规则同时带进数据问题

对照框架基于公开系统能力的工程归纳;UMI 来源:Universal Manipulation Interface

WORLD MODELS

世界模型扩展“可能发生什么”

工程推论,不是原文引用

Cosmos:可生成、可预测的物理 AI 世界

通过世界基础模型与数据处理框架,服务物理 AI 的合成数据生成、预测和评估。

公开来源:NVIDIA Research,2025

Genie 2:由图像提示生成可交互环境

探索大规模世界模型对多样环境与交互未来的生成能力。

公开来源:Google DeepMind,2024

覆盖

生成更多环境、初始状态与失败分支。

校准

真机数据用于确认感知、动作与接触偏差。

验证

部署成功率仍需回到真实机器人上测量。

我们的工程判断:生成经验负责扩覆盖真机轨迹负责校准与验收,二者不是替代关系。

TRAJECTORY ANATOMY

一条可训练轨迹,是七类信号的共同时间线

脱敏样例
一条轨迹 = 一次可回放的物理事件

不是把字段堆在一起,而是让观察、动作、接触、任务阶段和结果共享同一时间线,并能在之后重放、筛选、训练与评测。

看见多视角 RGB / RGB-D
位姿关节与末端状态
意图下发动作与操作者输入
执行真实执行动作
接触力、接触与状态变化
任务阶段、干预与恢复
结果成功、失败或中止

观测信号

  • 多视角 RGB / RGB-D 帧
  • 关节、末端与夹爪状态
  • 统一时间戳

动作与物理反馈

  • commanded / executed action
  • 力与接触事件
  • 接管、重试与恢复

任务上下文

  • 任务阶段与对象状态
  • 成功 / 失败 / 中止原因
  • 标定与数据集版本

TIME ALIGNMENT

错一帧,动作监督就可能指向错误的世界

灵御内部实测
<1μs

时间同步精度

6 路相机硬件同步,让视觉、遥控指令与 500Hz 关节力控反馈落在可对齐的时间基准上。

测试口径:同步控制器主时钟到各硬件触发端的通道间偏差。数值沿用 BP3 已披露工程口径;测试仪器、负载和样本量尚未形成公开复现报告。

六路传感器和控制信号由同一硬件时钟同步触发的示意图

SPATIAL CALIBRATION

知道“何时”,还要知道“在哪个坐标系”

灵御内部实测
机器人末端执行器在标定网格上进行多点触碰,并通过迭代降低绝对定位误差
<1mm

空间定位精度

把相机坐标、机器人基座坐标、末端执行器坐标与任务物体坐标连成可追溯的变换链。

动作表示是否可复现,取决于坐标系定义、标定版本和漂移检测,而不只是模型输出格式。

测试口径:末端执行器对精密校准网格目标点执行多点触碰,比较目标点与校准后实际触点的绝对残差。数值沿用 BP3 图示口径,未作独立审计声明。

TELEOPERATION

遥操作不是一个延迟,而是两个闭环

感知回路 ≠ 控制回路
操作员与机器人之间的视频反馈回路和动作控制回路示意图
遥操作视频封面
视频文字说明:操作者通过手持控制器输入意图,机器人端执行动作并回传多视角画面。观察重点是动作启动、视觉反馈与接触后的修正是否处于同一闭环,而非只看单次演示是否成功。
图示中的链路边界:曝光/编码/网络/解码/显示属于视频反馈环;采集/网络/重定向/逆解/力控/电机属于动作控制环。

MEASUREMENTS

把“低延迟”拆成可复测的工程量

以下均为灵御内部实测
指标测量边界测试口径 / 当前公开限制对数据的影响
<100ms
灵御内部实测
图像传输延迟从相机曝光链路开始到操作端显示完成;包含编码、网络、解码与显示。公开版暂不列网络条件分布。决定操作者感知与纠错时机
<30ms
灵御内部实测
本地控制延迟从本地动作输入采集到机器人控制接口接收;不与图像链路合并计算。决定意图和执行动作的时序一致性
10μs
灵御内部实测
底层控制周期逆解 / 底层控制计算周期的 BP3 工程配置口径;不是端到端遥操作延迟。决定高频反馈可用性
0-10N
灵御内部实测
关节力控范围当前系统公开的力控工作范围;机器人型号、关节与负载条件需在复现报告中逐项列出。支持接触事件与安全边界记录
250+
灵御内部实测
条 / 小时按已验收轨迹或原子动作计数的小时吞吐;任务复杂度不同,不直接换算为等量训练价值。决定数据回流速度
横向比较原则:本页暂不直接引用“业界常见延迟”。不同系统的采样端点、网络、编码链路与负载条件并不一致,未经统一协议的竞品数字不可比;当前 <100ms 只对灵御内部定义的图像链路负责。
测试口径说明:本页复述 BP3 已披露工程边界,所有数字均为内部测量,未表示第三方认证。

FIELD CASE

把演示视频当作实验记录,而不是宣传片

真实场景案例
真实场景实验视频封面
字幕式摘要:机器人在真实商业环境中执行接触与搬运相关动作。重点观察:环境是否发生遮挡或扰动、动作是否出现停顿或重试、人工干预如何被记录、最终任务状态如何判定。
机器人在烘焙零售场景中进行真实部署实验

视频加载失败时的场景参考图

实验记录应至少包含

任务:目标物、动作边界、结束条件

扰动:行人、遮挡、陈列变化、网络波动

失败 / 干预:停顿、重试、接管、恢复片段

成功标准:物理结果,而非“视频看起来完成”

直接播放:bilibili.com/video/BV1KwQEBxE82

PIPELINE

从任务定义,到可交付的数据包

接口契约,而非口号
01

任务定义

把“做什么”变成可验收协议。

  • 场景与对象
  • 初始 / 结束状态
  • 失败与中止条件
02

真机采集

让意图、执行与结果同源。

  • 多视角视频
  • 本体与动作
  • 接触和干预
03

语义结构化

把连续流变成可查询片段。

  • 任务阶段
  • 事件标签
  • 成功 / 失败
04

质量验收

对齐、标定、结果逐项过门。

  • 完整性
  • 时空一致性
  • 版本追踪
05

训练数据包

面向模型栈输出稳定接口。

  • 数据清单
  • schema / adapter
  • 质量报告

TA NEXUS

系统边界:采集、治理、训练、评测是一条链

六层架构

01 数据接入与时序对齐

多相机、本体、动作、力与任务事件接入;统一时钟与轨迹 ID。

02 遥操作与人工干预

操作输入、控制映射、接管与恢复事件作为一等数据记录。

03 质量处理与分段

完整性检查、异常检测、任务分段、结果与失败原因标注。

04 数据集与版本管理

数据清单、标定版本、许可范围、派生数据与模型血缘追踪。

05 训练适配器

面向 ACT、Pi0、VLA 等不同模型栈提供显式 schema 映射。

06 评测与回流队列

仿真筛选、真机评测、错误归因、困难样本与再采集优先级。

架构价值不在“按钮更少”,而在每次训练结果都能追溯到数据与采集条件

QUALITY GATE

数据质量不是清洗动作,是进入训练前的门

  • 信号与文件完整
  • 时间连续且可对齐
  • 空间标定版本有效
  • 动作与状态相互一致
  • 任务结果可验证
  • 失败 / 干预 / 恢复可分段
  • 数据与模型版本可追溯
  • 发布与使用许可明确

原则:门槛必须产生结构化拒绝原因,否则“删除坏样本”只会把系统问题藏起来。

REJECTED SAMPLE / QG-TIME-04

拒绝:腕部相机时间戳跳变 83ms

现象:画面中的抓取接触先于记录动作发生。

风险:模型会把错误状态当作动作前提。

处置:从训练集隔离;保留为采集链路回归测试;检查网络缓冲与时钟重同步事件。

CLOSED LOOP

训练不是终点,真机评测也要成为数据

Train · Evaluate · Return
真机轨迹可信物理事件
策略训练版本化数据清单
仿真 / 世界模型扩展状态与失败分支
真机评测独立任务与环境
错误归因感知 / 动作 / 接触 / 时序
困难样本回流再采集优先级
真实轨迹 → 训练 → 扩展 → 真机评测 → 归因 → 回流 ↺

训练指标回答

模型在给定数据与损失函数上学到了什么?

评测工件回答

它在独立场景中做成了什么,为什么失败,下一条数据该采什么?

OPEN PROBLEMS

真正难的部分,还没有被数据量抹平

平台责任与当前方向

作为一身多脑的数据平台,我们不需要假装已经解决所有开放问题。需要回答的是:哪些属于平台责任,当前走到哪一步,哪些仍然是研究问题。下面的“当前方向”是现有架构与数据流程的公开边界,不等同于已完成的产品能力。

TAKEAWAYS

三条结论,以及可以共同定义的接口

01 轨迹是同步的物理事件记录

视频、状态、动作、接触和结果必须共享可追溯的时间与空间基准。

02 质量在采集现场被创造

同步、标定、任务协议和干预记录,无法只靠后期清洗补齐。

03 部署、训练、评测是一条回路

每次真机失败都应该能回到数据队列,成为下一轮采集优先级。

可与社区继续讨论的四类工件

SCHEMA
最小轨迹字段与事件词表

REPORT
同步 / 标定测试报告格式

BENCHMARK
失败、干预与恢复的评测协议

GOVERNANCE
真实部署数据的脱敏与许可清单

本次公开:演示稿、脱敏轨迹字段与事件词表片段,以及质量门示例。未承诺尚未准备好的数据集或代码仓库。

REFERENCES

一手来源与内部测量说明

可点击链接

灵御内部实测

时间同步、空间定位、图像传输、本地控制、底层控制、力控范围与小时吞吐,均来自灵御现有 BP3 工程材料。

本稿已注明测试口径及公开限制;这些数字不表示独立第三方认证。后续公开复现时应补充设备、负载、网络条件、样本量和统计分布。

演示稿

下载 PDF 版本

网页:darkthree.com/speech2/
内容许可:CC BY 4.0(第三方图片、视频与引用材料除外)