Skip to content
活动#DeepRobotics#VLN#数据
Astraluster·2026-09-24·约 8 分钟·活动笔记 · 整理自 Notion

云深处交流活动笔记:流式 VLA、模块化导航与训练数据 ​

参加云深处 DeepRobotics 交流活动时记下的三个主题,外加一点我自己对世界模型与 VLA 闭环的补充理解。

1 · StreamingVLA:让 VLA “边看边想边动” ​

论文:StreamingVLA

一次机器人决策通常包含三段时间:Tobserve(理解观测)、Tgen-action(生成动作)、Texecution(执行动作)。如果三段严格串行,模型计算时机器人在空转,机器人执行时模型又闲着,交互频率和流畅度都被拖慢。

StreamingVLA 把动作生成与执行做成流水线并行:不再一次生成很长的动作序列,而是生成一个动作 chunk 就立刻交给执行端,同时下一步推理继续进行,让“算”和“动”重叠。收益是两点:更快(单位时间内有效动作更多)和更流畅(动作间停顿更少)。

关键权衡在 chunk 长度 h:

  • h 越大,吞吐可能更高,但对新观测的响应变慢;
  • h 越小,响应更及时,但推理更频繁,可能降低吞吐。

为此论文引入可选的 Replan 和“何时需要更新观测”的策略,在保证执行连续性的同时尽量及时吸收新的视觉反馈。

联系

这和 LIBERO-Recover 的发现呼应:action chunk 越长,失败后越难恢复。见 失败之后怎么办。

2 · 模块化的具身导航(VLN) ​

目标:用地图软件(路网、POI、建筑轮廓)做全局规划,但不依赖提前建图;靠机器人自身定位与在线感知完成局部避障和到达判定,让系统在地图不完美、环境动态变化时依然稳定。

模块化的价值在于每一层都能单独诊断和替换:

  1. 指令理解(VLM/LLM):自然语言 → 结构化目标与候选目标。难点是“门口 / 前台 / 电梯”是语义目标,而 POI 往往只是一个坐标点。
  2. GIS 查询与候选生成:常见误差有 POI 偏移、入口缺失、路网可通行性过时(施工、围挡、闸机)、室内信息缺失。
  3. 目标可靠性判断:系统的安全阀——地图与机器人自身信号不一致时,不应继续按地图强行执行。
  4. 全局规划:基于路网的粗粒度路线,缺少台阶、坡道、门禁、窄通道等细节。
  5. 定位与局部规划:IMU / 轮速 / 视觉 / 激光,定位漂移会让全局路径跟踪逐步偏离。
  6. 安全检查与重规划:到达判定不应只看“离 GIS 点多近”,而要结合语义与可达性。

GIS 不准时怎么办? ​

  • 把 GIS 当先验而非真值:给 POI、入口、路网节点附带位置不确定度,判断都基于“误差范围内是否一致”;
  • 一致性检验:激光/深度边界与建筑轮廓的几何匹配、当前位姿是否落在可通行区域、接近目标后能否看到目标语义;
  • 定位融合:室外 GNSS/RTK 提供全局约束,室内靠 SLAM 闭环纠偏,室内外切换处做一次对齐;
  • 规划层融合:全局给方向,局部以在线代价地图为准,局部长期失败要反推全局层更新假设;
  • 目标建模升级:从“一个 POI 点”升级到“可达目标区域 + 入口候选集”,用距离、可通行性、语义匹配和不确定度综合选择。

3 · 具身智能的三类训练数据 ​

真机采集:物理真实、误差真实、分布最贴近部署,但成本高、风险高、效率受限。常依赖遥操作 / 示教,或动作捕捉后经运动学 / 动力学约束拟合到机器人上。

3DGS 场景仿真:用 3D Gaussian Splatting 把真实环境“搬进仿真”,外观更逼真。但 3DGS 偏渲染层,真实物理交互通常要“渲染用 3DGS + 碰撞用简化网格”的组合。

世界模型生成:用懂物理的生成模型预测动作帧与状态序列。但目前对接触动力学的理解还不可靠,容易出现关节速度/力矩超限或模式坍塌,更适合作为补充数据源,并配合可执行性检查与仿真回放筛选。

我的补充:Blender 资产管线

如果目标是稳定地产生带物理一致性的交互数据,可以把 Blender 当作“资产与场景编辑器”,把 Isaac Lab 等仿真器当作“物理与数据引擎”:Blender 建模并显式制作简化碰撞体 → 导出 USD → 在仿真器里配置关节限位、力矩上限、控制频率 → 用脚本 / 策略跑大量 rollout,自动记录 RGB / Depth / Seg、关节状态、接触事件与动作。实际工程里这条线往往会走向“仿真数据生成 + RL 训练调参 + 真机微调”的一体化流水线。需要高逼真外观时,再叠加 3DGS 作为渲染层。

4 · 补充:世界模型要服务于行动闭环 ​

世界模型不应只停留在“预测未来”。如果预测结果不参与后续决策,它更接近一个 predictive model。完整的具身闭环是:

ot→zt→z^t+1:t+H→at∗→Executive Action→ot+1real
  • World Model:如果采取某个动作,未来会发生什么?
  • Policy / Planner:基于预测,我应该选什么动作?
  • Executive / Controller:这个动作如何真正由机器人执行?

世界模型的价值不只在预测误差更小,而在于预测出的未来能否改善动作选择、长程成功率与闭环稳定性。

一个小的数学备忘:SIGReg 是经验期望 ​

SIGReg(Z)=1M∑m=1MT(h(m))≈EH∼p(H)[T(H)]

注意是先逐样本过 T 再求平均,一般 1M∑mT(h(m))≠T(1M∑mh(m)),除非 T 是线性的——这对非线性神经网络表征尤其重要。

VLA 常见的动作输出格式 ​

  1. 连续动作向量:如末端增量 [Δx,Δy,Δz,Δrx,Δry,Δrz,g];
  2. Action Chunk:一次预测未来 H 步,At∈RH×7;
  3. 离散 Action Token:量化后由语言模型式结构自回归预测,再解码回连续量;
  4. Latent / Diffusion Action:通过扩散或 flow matching 生成动作轨迹,最终仍解码为连续 chunk。

记得更少,但记住真正影响未来的东西。