Skip to content
论文精读#Zeno-1#FailureRecovery#WorldModel
Astraluster·2026-09-28·约 25 分钟·整理自 Notion

失败之后怎么办:协作机器人偏差适应与恢复六篇论文精读 ​

研究问题

如何理解 Zeno-1 一类协作机器人中的“偏差适应 / 失败性回调”?核心不是“失败后重启”,而是机器人在闭环交互中持续判断伙伴与共享物理状态是否仍然兼容;当出现延迟、相位错位、抓取不稳或接触冲突时,通过等待、减速、让步、保持、重新定位或重新规划来重新建立可协作状态。等待伙伴恢复只是其中一种特例。

从 Zeno-1 出发:我们在找哪一类论文? ​

Zeno-1 的材料把协作智能拆成几块:每个机器人独立运行相同策略、从本地视觉/本体/交互历史决策;用 Closed-loop Partner Interaction(CPI) 让机器人直接和自主伙伴互动;在容易协调崩溃的时刻做 targeted correction;引入持久的交互记忆;以及通过 action-conditioned world model 做预测性内省,在动作执行前评估滑落、抓取失败、物体干涉与伙伴反应。

所以相关文献要沿四条线读:

  1. 伙伴偏差适应:partner delay、相位错位、yield / wait / resume;
  2. 失败前预测:执行前预测是否会进入高风险状态;
  3. 失败后的恢复与再规划:不重置任务,从当前失败状态继续;
  4. 失败数据回流训练:把干预 / 失败 episode 重新加入训练。

1 · SAI:协作不是换网络,而是换“训练时见到的伙伴” ​

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

两台移动双臂机器人通过同一个物体发生物理耦合(展开桌布、收衣物、搬画框)。单体技能好不等于协作好——只要时序不一致,仍会一起失败。论文归纳了三个瓶颈:Temporal phase coupling(阶段相位一致)、Partner-contingent yielding(伙伴延迟时会减速、暂停、重新对时)、Interaction conflict mitigation(避免反向施力、过大内力)。

关键是一个三阶段的伙伴分布课程:

  • Stage 1:Robot A 与顺从的伙伴学基本技能;
  • Stage 2:冻结 A,让人遥操作 B 去配合真实部署的 A,并主动加入速度缩放、动作噪声、时序偏移——B 学到的是“如何配合一个会犯小错的 learned partner”;
  • Stage 3:两台都自主运行,只在协调失败边缘做稀疏的 DAgger 式干预,纠正数据再回流微调。

论文专门做了 Partner Delay Test:人为暂停 Robot B。独立模仿学习的 A 继续拉桌布,导致不对称张力;SAI 的 A 会减速、等待,B 恢复后再继续。要注意,恢复目标不是“回到原来的绝对轨迹点”,而是等到联合状态重新具有协作兼容性。

SAI 没有显式 world model,是“偏差出现以后学会 wait / yield / resume”;Zeno-1 想更进一步——在偏差发生之前预测不兼容,并提前调整。

2 · PlayWorld:世界模型必须见过“失败” ​

PlayWorld: Learning Robot World Models from Autonomous Play

很多机器人世界模型用人类示范训练,而示范天然 success-biased:很少有抓空、滑落、碰撞。于是模型遇到这些动作时会偏向常见的成功结局——论文称之为 hallucinated success。

PlayWorld 用 VLM 提任务 + VLA 执行 的闭环做自主“玩耍”式数据采集:VLM 看场景生成指令并做小幅语义扰动,VLA 执行出多样的接触模式,配合安全过滤可以无人值守连续运行数小时。世界模型是动作条件的视频扩散模型,同时预测三个相机视角;再用“离成功分布的距离”做课程,先学常见交互、后学罕见交互。

结果上,它对 18 个不同水平策略的成功率预测与真实结果高度相关(Pearson ≈ 0.88),并能在世界模型内部做 RL 微调(DSRL:冻结扩散策略,只学去噪初始噪声的 steering 策略),真机成功率最高提升约 65%。

对我们的启发:Failure Callback 的上限,受 failure-transition 覆盖度限制。 如果世界模型只见过成功,所谓“World Model → Failure Critic”从根上就不可信。

3 · Model-Based Runtime Monitoring:执行前先问“继续下去会不会出事” ​

Model-Based Runtime Monitoring with Interactive Imitation Learning(ICRA 2024)

目标:机器人自己监控自己的未来,只在风险高时请求人类注意。四个组件:观测编码器、cVAE 动力学模型(可采样多条未来)、与之共享 latent 的策略、在冻结 latent 上训练的失败分类器。

很聪明的一点:把人类介入前的状态当作失败监督——人觉得“再不接管就要错了”时的介入本身就是风险标注,不必真的把机器人撞坏。

运行时采样约 200 条想象的未来、各向前 10 步,先做 OOD 检测,再做失败分类,多条未来平均后超过阈值才判危险;还加了时间去抖(过去 10 步里至少 5 步判失败才报警)。消融显示 OOD 与失败分类器二者结合最好:前者擅长发现大范围陌生状态,后者擅长瓶颈处细微但危险的变化。

它最像“失败回调”的判定模块,但回调的动作是“把人叫回来”。把 Human Intervention 换成学到的 Executive Recovery Policy,是自然的扩展。

4 · Guardian:高层计划与子任务的 VLM 验证器 ​

Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models

Guardian 不在几十 Hz 的接触控制层,而是检查两件事:计划本身错没错,以及子任务执行后结果是否符合要求。

真实失败数据稀缺,作者从成功轨迹出发程序化构造失败:计划层面有抓错物体、放错状态、顺序错误、缺少子任务、矛盾子任务五类;执行层面在仿真里直接扰动动作。最终得到 GuardianFail-36k,并为每个样本生成逐步推理链——模型学的不只是 False,而是“为什么错”,这段推理可以直接反馈给重规划器。

几个实用发现:多视角图像分开输入比拼成网格更准;显式思维链最准但慢(约 4.3 s/样本),训练时随机丢弃思维链、测试只出答案能在精度接近的同时降到约 0.68 s。论文自己的误差分析指出,错误主要来自感知而不是推理——看错抓取状态、上下关系、朝向等细粒度空间关系。

Guardian 适合做高层回调:plan / subgoal → verify → failure reason → replan / retry。低层的 wait / yield 仍需要世界模型与接触 critic。

5 · LIBERO-Recover:重新定义“该怎么测恢复” ​

LIBERO-RECOVER: Beyond Task Success Towards Failure Recovery in Robotic Manipulation Models

传统 benchmark 问“这次任务做成了吗”,真实部署更常问“做错一次以后还能不能继续”。论文给出四级恢复:

级别含义对应回调
L1 Action Retry失败几乎没改变配置,如抓空但物体没动retry
L2 Action Adaptation物体有限变化,需要改动作方式local replan
L3 Object State Recovery任务对象被明显改变,需先恢复它subgoal recovery
L4 Environmental Recovery环境中其他对象成了阻碍task-level replan

Benchmark 包含 2178 个恢复场景,另收集了 3184 条专家恢复轨迹。三个特别值得记住的发现:

  • Action chunk 越长,恢复越差:一次承诺太长的动作序列,失败后看不到新状态;
  • 只加恢复数据,不会自动提升自发恢复:会从“给定的失败状态”恢复,不等于能在线识别自己刚失败了并切换模式(failure-recovery transfer gap);
  • 时间上下文很重要:额外给出任务初始帧,能让模型比较“现在 vs 本来应该是什么样”。

6 · DA3C:控制论早就在做“偏差后修改参考” ​

Decentralized Ability-Aware Adaptive Control for Multi-robot Collaborative Manipulation

异构机器人协同搬运,各自力矩上限不同。若强行追踪一条固定参考轨迹,某台机器人到了力上限还要输出不可实现的力。作者的思路:原任务超出团队当前能力时,修改参考,而不是继续死追。

两层机制:先用冗余自由度做零空间运动,让每台机器人的力可操作度椭球尽量匹配任务需求方向;当某台真的到达力上限,只广播 control deficiency,由自适应参考模型生成新的可行参考轨迹,其他机器人一起跟踪,并有 Lyapunov 稳定性证明。

它提醒我们:“根据伙伴偏差调整自己”不是 AI 新概念。新的地方在于不再依赖完整显式动力学与手工控制律,而是从视觉、历史和交互数据中学习协调规律,并在约束真正被违反之前就做出调整。

放在同一个坐标系里 ​

工作核心能力显式世界模型回调发生在哪最值得借鉴
SAI伙伴延迟下 wait / yield / resume否闭环策略 + 干预伙伴分布课程
PlayWorld物理未来与失败预测是执行前 rollout富失败数据
Runtime Monitoring预测风险并请求干预是(latent)运行时风险门future rollout + risk gate
Guardian计划 / 执行错误检测否规划 / 子任务层带推理的验证器
LIBERO-Recover恢复能力评测—失败之后恢复分级 + 评测
DA3C能力不足时修改参考显式控制模型约束触发修改参考而非死追

拼出一条更完整的研究链 ​

Propose → Predict Physical Future → Predict Partner Response → Risk Critic → Execute / Callback → Observe → Recover → Failure Buffer → Targeted Fine-tuning

其中回调动作不应只有 stop:continue、slow、wait、hold、yield、reposition、retry、local replan、subgoal recovery、task-level replan。SAI 覆盖前半段,LIBERO-Recover 提醒我们后面还有更高层的恢复。

需要强调:这六块在现有论文里还没有被一篇工作统一成同一个 Partner-Aware World Model + VLA Executive Loop——这既是研究空隙,也意味着需要更系统的文献检索来确认 novelty 边界。

建议阅读顺序 ​

  1. SAI:建立对伙伴相位错位、让步等待的直觉;
  2. Runtime Monitoring:理解失败预测如何真正进入执行闭环;
  3. PlayWorld:理解失败数据对世界模型物理可信度的重要性;
  4. Guardian:补上高层计划验证与基于推理的重规划;
  5. LIBERO-Recover:形成自己的恢复分级与评价体系;
  6. DA3C:回到控制论视角,理解学习式协作与参考自适应的关系。

一句话总结:机器人应持续估计伙伴与共享世界的未来可兼容性,在出现或即将出现协调偏差时主动改变自身动作,让系统进入新的可协作状态——而不是强行追踪原来的联合轨迹。

记得更少,但记住真正影响未来的东西。