Skip to content
VLA#研究方案#π0.5#ResidualRL
Astraluster·2026-09-29·约 16 分钟·整理自 Notion

一张 5090 能做什么:Temporal World Prior × Goal Critic 研究方案 ​

资源约束版

实验资源:1 × RTX 5090(32 GB,共享),加上极少的云算力预算。核心原则:先证伪最关键的科学假设,再逐步解锁 Token Selection、长期记忆与 World-Model Foresight;不把 π0.5 全量训练当作前提。

π0.5 不是研究核心 ​

统一把基础 VLA 写成:

at0∼πbase(a∣ot, l, st)

实验里可以令 πbase=π0.5,但方法本身应保持 backbone-agnostic。π0.5 的作用是提供强动作先验、可离线缓存的 Teacher 信号,以及一个可复现的实验宿主。这个项目要验证的是:

Temporal World Prior→Goal-Relevant State→Goal Value→Policy Improvement

两级状态:世界是什么 vs 任务关心什么 ​

与任务无关的世界状态——回答“世界正在发生什么”:

Ztworld=EJEPA(Ot−K:t)

与目标相关的状态——回答“对当前任务,哪些状态会影响成功”:

Ztgoal=Gψ(Ztworld, el, st),el=EL(l)

语言 / VLM 提供语义目标与常识,LeVJEPA 提供时序与物理动力学先验:Pworld=Psemantic+Pdynamic。

Base VLA + Goal Critic + Residual Policy ​

Goal Critic 估计“这个动作最终能不能完成任务”:

Qϕg(ht,at)≈E[∑k≥0γkrt+k | ht,at,g]≈P(Success∣ht,at,g)

核心不是 action residual regression,而是 value / success regression。残差策略:

Δat=πres(ht, at0, g),at=at0+αtΔat

真正要求的是修正后的价值更高 Acorr=Qg(ht,at0+αtΔat)−Qg(ht,at0)>0,而不是 Δat≈atGT−at0。所以修正可以和示范不同,只要它提高最终成功概率。

最具辨识度的候选:Goal-Value-of-Information ​

LeVJEPA 已经说明大量观测可以丢弃,那么“任务信息价值”该怎么定义?对第 i 个 token:

Vt,iinfo=Qg(Zt,at)−Qg(Zt−i,at)

Vinfo≈0:该 token 对任务成功判断几乎没贡献,可不写入长期状态;Vinfo≫0:删掉它会显著改变 Critic 的判断,应优先保留。问题因此升级为:What information is worth remembering for future goal achievement?

关键工程决策:把 Base VLA 从训练图里拿掉 ​

OpenPI 公开的单卡显存需求约为:推理 >8 GB,LoRA 微调 >22.5 GB,全量微调 >70 GB。所以 π0.5 全量微调不作为前提。做法是先离线跑一遍 Frozen VLA Teacher,缓存:

D+={Ot−K:t, l, st, atbase, ztteacher, atdemo, rt, donet, success}

之后正式训练时,πbase 完全不在 GPU 计算图中。5090 只承担冻结/部分解冻的 LeVJEPA、小型融合层、Goal Critic 和 Residual Actor。Teacher Cache 也不保存完整 hidden states,只存 pooled 表征、8/16/32 个 query-pooled token、base action chunk 和元数据,FP16/BF16 存储。

步骤输入模块输出
1视频历史 Ot−K:t冻结 LeVJEPAZtworld
2Ztworld + 语言目标 + 机器人状态Goal Fusionht
3ht缓存的 π0.5 先验(离线)at0
4ht, at0Goal CriticQg
5ht, at0Residual ActorΔat
6Qg, Δat价值门控at=at0+αtΔat

数据:小数据先证伪 ​

  • D0 · 调通流水线:LIBERO + DROID-100 或少量自选轨迹;
  • D1 · 核心实验:LIBERO 四个 suite + RoboTwin 2.0 的少量高信息密度任务;
  • D2 · 表征扩展:确有必要时再远程流式处理 DROID(全量 RLDS 约 1.7 TB,不适合本地常驻),构建几十 GB 到 100 GB 的 DROID-mini。

第一阶段 MVP:只验证最关键的因果链 ​

不要先做“大一统世界模型”。第一阶段只回答:时序 JEPA 状态是否让 Goal Critic 更准?更准的 Critic 是否真的能让冻结的 VLA 更容易被纠偏?

模型内容
M0单帧 Critic Qimg(It,l,st,a)
M1冻结 LeVJEPA 时序 Critic Qtemp(Ot−K:t,l,st,a),核心比较 Err(Qtemp)<Err(Qimg)
M2M1 成立后加入 Goal Critic + Residual Actor
M3LeVJEPA 轻量适配:冻结 → 末 2 层微调 → 末 4 层 / LoRA,不默认全量微调

重点场景:滑移、接触转换、部分遮挡、延迟后果、失败的接近、物体状态改变、执行扰动。

训练目标 ​

Goal Critic(Huber TD):

yt=rt+γ(1−dt)Vϕ¯(ht+1),LQ=Huber(Qϕ(ht,at), yt)

资源有限时可以先做成功分类器:Lsucc=BCE(pϕ(success∣ht,at,g), ysucc)。

Residual Actor(最大化目标价值 + 最小干预):

Lres=−Qϕ(ht, at0+αtΔat)+λa∥αtΔat∥2+λααt

四个 Go / No-Go 决策点 ​

  1. 时序 Critic 成立吗? 若 Qtemp 在扰动、接触、遮挡场景都没有稳定优于 Qimg,暂停 Residual / Memory 扩展,重新检查时序表征与控制的相关性。
  2. Critic 的提升能转化为策略提升吗? 若 Critic 更准但 Successres≈Successbase,问题在修正接口或策略优化,而不在 Encoder。
  3. Goal-Value 选择能超过随机丢弃吗? 若 GoalValueTopK≤RandomTopK,就不能声称“选对 Token”有效。
  4. Memory / Foresight 对长时序有额外价值吗? 只在短时系统成立后再验证。

暂时不做的事 ​

π0.5 全量微调;π0.5 LoRA + 全量 LeVJEPA 同卡训练;本地下载完整 DROID;从零训练大 LeVJEPA;大规模在线 RL;第一版就加 Mamba + 多步世界模型;多 backbone 全矩阵。云 GPU 只用于最终论文表格,不用于日常调试。

先证明“鲁棒世界表征 ≠ 精确控制表征”这个 mismatch 真实、可重复;再证明弱耦合的精度修正能补上缺口。不要一开始就把 Encoder、Critic、Residual、Token Selector、Memory 全部端到端耦合。

记得更少,但记住真正影响未来的东西。