CONTACT-EVENT READING OF CR-DAGGER · 2026-09-16

力诀窍即接触事件

核心假说:CR-DAgger 真正起作用的,是人手介入把机器人送进几个关键的接触事件。所谓「力诀窍」,就是这几步的有序序列,以及每一步该有的力。
每组左边失败、右边成功,下面先列这个任务的诀窍分几步,再说基础策略掉在第几步。 这个解释不是原作者的说法——原文把有效性归因于 on-policy delta 更平滑、分布偏移更小、残差能吃力模态。 视频来自 项目页(Xu, Hou, Xin, Liu, Song, NeurIPS 2025, arXiv:2506.16685),已转码压缩。右上角 1x/3x/4x 是原页标注的播放倍速。

01核心观察

把项目页上所有失败视频的原始命名列出来,不加任何解读:

任务原始命名字面含义
翻书Incomplete flipping翻起来了但没立住
翻书Missed insertion铲形工具没插进书底
翻书Insert too high插的位置太高
皮带Stuck on base卡在大轮上不动
皮带Missed the slot皮筋没进轮槽
齿轮Missed insertion齿轮与轴对不齐
线缆Missed slot线缆没穿过槽
四个任务、五种命名,没有一个是「轨迹偏了」「速度不对」「精度不够」
全部是某个接触约束没建立起来,或者建立到一半断了。这不是我们的解读,是原作者自己给视频起的名字。

02翻书:三步诀窍

力诀窍
  1. 先插到底面 —— 铲形工具先贴住搁板平面建立面接触,再沿着这个面前滑进书底。关键的力是「压住平面的法向力」加「前滑的切向阻力」。
  2. 稳定抬升 —— 抬的过程必须一直保持与书的接触,力要连续、不能丢。丢了接触书就掉回去。
  3. 最后往墙面再靠一下 —— 把书推靠架壁,输出一个特定量级的顶压力。这是全任务唯一需要「用多大力」这个量的时刻。

掉在第 1 步Missed insertion

1x
✗ Base Policy: Missed insertion
3x
✓ Base + Compliant Residual
为什么失败
原文说是「手指过高或对准两书之间的缝」。按诀窍看就是第 1 步没做——没有先把铲子贴到搁板平面上,就直接在空中找高度。没有面接触这个参照,高度只能靠视觉猜,而书缝在图像里很窄。
为什么成功
带力的残差先把铲子压到平面上(法向力出现 = 确认贴住了),再沿着这个面往前滑。平面接触本身就是一个高度基准,贴住之后高度问题自动消失。

掉在第 3 步Incomplete flipping

3x
✗ Base Policy: Incomplete flipping
3x
✓ Base + Compliant Residual
为什么失败
原文说是「最后阶段刀片收回过早,书倒下」。按诀窍看是第 3 步没做——书抬起来了,但最后那一顶没有,所以没靠稳架壁,手一撤就倒。
为什么成功
原文明写最后阶段需把书用力推靠架壁才能自立,而带力的柔顺残差在此预测大力。这一步要的不是位置精度,是「输出多大力」——纯位置策略在原理上就给不出这个量。
100%
「立稳」阶段 · 带力残差(附录 A.2)
70 → 35%
同阶段 · 去掉力之后
+45pp
整任务 · 带力 vs 最好的仅位置基线

03皮带:四步诀窍

力诀窍
  1. 夹住皮筋并绷开 —— 开口要够大才能套过大轮。
  2. 先挂上小轮 —— 建立第一个约束,后面的拉力才有支点。
  3. 拉向大轮,指尖碰到轮顶后沿轮缘找槽 —— 原文原话:柔顺残差「学会在手指碰到轮顶时沿轮缘找槽」。碰到轮顶是一个触发事件,它启动下一段搜索。
  4. 确认皮筋落入轮槽,然后撤离 —— 落槽会产生可辨的力变化,确认之后才能松手。

掉在第 3 步Missed the slot

4x
✗ Base Policy: Missed the slot
4x
✓ Base + Compliant Residual
为什么失败
原文说是「指尖过高或过低,皮带未进大轮槽」。第 3 步的触发事件没发生——没碰到轮顶,或者碰到了但没启动沿轮缘的搜索,高度全靠视觉猜。而轮顶在图像里被遮挡、又缺深度信息,视觉在这里基本无效。
为什么成功
带力的残差把「碰到轮顶」当成事件用:法向力一出现,就切换成沿轮缘滑动搜索,直到落槽。这是全文写得最清楚的「接触事件触发下一段动作」的例子。

掉在第 4 步Stuck on base

4x
✗ Base Policy: Stuck on base
4x
✓ Base + Compliant Residual
为什么失败(逐帧读像,原文未单独命名此条)
夹爪夹着橙色皮筋压到大轮上之后就停住了——皮筋没落进轮槽,夹爪也没脱开,最后一帧仍顶在轮面上。第 4 步的确认事件没发生,策略既不敢推进也不敢撤离,卡死。
为什么成功
落槽产生的力变化被检测到,确认之后才松手撤离。整个第 3、4 步是一个「碰 → 搜 → 确认 → 放」的闭合序列。
这条和 Missed the slot 是同一个缺失事件的两种表现
一个是没碰到槽就走了,一个是压在轮上但没确认落槽。两个失败命名,一个接触事件。

04齿轮插入:三步诀窍

力诀窍
  1. 先让齿轮端面碰到轴顶 —— 建立单点接触,拿到轴的位置基准。
  2. 保持轻接触,沿轴顶滑移搜孔 —— 力要小,太大就卡住、太小就脱开。
  3. 对上之后下压插入,并与邻轮啮合 —— 从单点接触转成两点约束。
1x
✗ Base Policy: Missed insertion
1x
✓ Base + Compliant Residual
为什么失败
原文说基础策略「齿轮与轴对不齐,无法与邻轮啮合」。第 1 步就没建立——没有先碰到轴顶拿基准,后面的搜孔无从谈起。
为什么成功
先碰后搜。这正是 Whitney 1982 描述的单点接触 → 两点约束序列——插装任务的接触状态机 1982 年就写清楚了,而它只在力里可判别。
齿轮插入是四个任务里对力最敏感的:基础策略不给力输入时成功率 5%力输入升到 40%(8 倍),CR 最终 90%

05线缆走线:串联约束

力诀窍
  1. 线缆送入第一个卡槽,建立约束
  2. 保持张力送入第二个 —— 张力丢了,前一个约束会脱开。
  3. 依次到第三个 —— 任一处没建立,就走不到下一处。
1x
✗ Base Policy: Missed slot
1x
✓ Base + Compliant Residual
为什么失败
某一处卡槽的约束没建立。线缆是柔性的、约束是串联的,前一个不牢后一个就没有支点。
为什么成功
逐个确认约束建立后再推进下一个,全程维持张力。

06最强证据:去掉力,恰好掉在那一步

同一个残差架构、同一批纠正数据,唯一差别是有没有力模态
如果诀窍假说成立,去掉力之后失败的方式应当精确落在那个必须靠力才能判别的步骤上,而不是随机劣化。

翻书 · 掉在第 3 步Residual w/o force

3x
✗ Residual w/o force: Incomplete flipping
3x
✓ Compliant Residual(带力)

去掉力之后失败的正是最后那一顶——三步诀窍里唯一需要输出特定力量级的那一步。第 1、2 步基本靠位置就能完成,所以没受影响。

皮带 · 掉在第 3 步Residual w/o force

4x
✗ Residual w/o force: Missed the slot
4x
✓ Compliant Residual(带力)

去掉力之后失败的正是「碰到轮顶」这个触发事件的检测。轮顶被遮挡且缺深度,视觉看不见,只有力能告诉你碰到了。整任务带力比最好的仅位置基线高约 53 个百分点

07接管式纠正也栽在同一步

1x
✗ Take-Over correction: Insert too high
3x
✓ On-Policy Delta correction
原文的解释
归因于接管数据不平滑、分布偏移大(图 10、图 11)。
诀窍假说的解释
接管时人是从零开始重新控制,反而打断了正在建立的接触约束序列;而 on-policy delta 是在已有约束上叠加微调,序列不断。两种解释可以同时成立,但对「什么样的纠正接口更好」的预测不同。
4x
✗ Take-Over correction: Missed the slot
4x
✓ On-Policy Delta correction

08与 Johansson 的对应

我们拆的「三步 / 四步诀窍」,就是 Johansson 的 action phase 序列
Johansson & Flanagan(Nature Reviews Neuroscience 2009):操作任务由一串 action phase 组成,每个 phase 完成一个子目标,而子目标的边界就是离散的机械接触事件。大脑预测每个事件该有什么感觉,拿实际的去比。预测对上了就不需要纠正,任务以前馈方式运行;只有预测失配才触发习得的纠正动作。这些事件叫 sensorimotor control points

一条路径是从机器人论文的失败命名反推,一条是感觉运动神经科学在人身上的直接测量,两者结构相同。

这条对应还带出一个推论:如果闭环只发生在控制点上、点与点之间是前馈的,那么通信延迟惩罚的是控制点处的比较,而不是整个过程诀窍步数越少、间隔越远的任务,延迟越便宜——这正是远程力反馈遥操可能替代扶臂动觉示教的理由。

09可检验的推论

检验做法假说预测
T1时间集中性 测纠正信号(ΔX 与力)在 episode 内的时间分布:80% 的纠正「能量」落在多大比例的时间里 高度集中(如 20% 以内),且集中在诀窍步骤的边界附近
T2掩码消融(决定性) 把诀窍步骤边界 ±Δt 之外的纠正数据全抹掉,重训残差 性能基本保住 → 信息确实集中在这几步上;崩掉 → 假说被证伪
T2 完全不需要远程、不需要延迟、不需要新硬件
可以先在本地把「诀窍步骤才是关键」证出来,然后「所以远程也行」就变成一个推论,而不是要从头验证的主张。
这会重排整个项目的顺序:先证机制(便宜、本地),再做远程系统(贵)。
事件检测器现成就有:2026-09-11 Helios DualProxy log 里的 contact_phase(FREE / CANDIDATE / CONTACT / RELEASE)与 fspf_rank 跳变。

10边界与引用规范

可以说不能说
CR 的失败命名全部是接触事件失败(可核)把「诀窍 / 事件假说」写成 CR 原作者的结论
去掉力后失败落在需要力的那一步(Finding 2 可核)在 T1/T2 跑出来之前,宣称假说已验证
100% vs 35% 是附录 A.2 的分阶段数字把我们拆的「几步诀窍」当成原文表述
Stuck on base 的解析注明是逐帧读像把压缩后的视频当作原始实验数据