一张 5090 能做什么:Temporal World Prior × Goal Critic 研究方案
资源约束版
实验资源:1 × RTX 5090(32 GB,共享),加上极少的云算力预算。核心原则:先证伪最关键的科学假设,再逐步解锁 Token Selection、长期记忆与 World-Model Foresight;不把 π0.5 全量训练当作前提。
π0.5 不是研究核心
统一把基础 VLA 写成:
实验里可以令
两级状态:世界是什么 vs 任务关心什么
与任务无关的世界状态——回答“世界正在发生什么”:
与目标相关的状态——回答“对当前任务,哪些状态会影响成功”:
语言 / VLM 提供语义目标与常识,LeVJEPA 提供时序与物理动力学先验:
Base VLA + Goal Critic + Residual Policy
Goal Critic 估计“这个动作最终能不能完成任务”:
核心不是 action residual regression,而是 value / success regression。残差策略:
真正要求的是修正后的价值更高
最具辨识度的候选:Goal-Value-of-Information
LeVJEPA 已经说明大量观测可以丢弃,那么“任务信息价值”该怎么定义?对第
关键工程决策:把 Base VLA 从训练图里拿掉
OpenPI 公开的单卡显存需求约为:推理 >8 GB,LoRA 微调 >22.5 GB,全量微调 >70 GB。所以 π0.5 全量微调不作为前提。做法是先离线跑一遍 Frozen VLA Teacher,缓存:
之后正式训练时,
| 步骤 | 输入 | 模块 | 输出 |
|---|---|---|---|
| 1 | 视频历史 | 冻结 LeVJEPA | |
| 2 | Goal Fusion | ||
| 3 | 缓存的 π0.5 先验(离线) | ||
| 4 | Goal Critic | ||
| 5 | Residual Actor | ||
| 6 | 价值门控 |
数据:小数据先证伪
- D0 · 调通流水线:LIBERO + DROID-100 或少量自选轨迹;
- D1 · 核心实验:LIBERO 四个 suite + RoboTwin 2.0 的少量高信息密度任务;
- D2 · 表征扩展:确有必要时再远程流式处理 DROID(全量 RLDS 约 1.7 TB,不适合本地常驻),构建几十 GB 到 100 GB 的 DROID-mini。
第一阶段 MVP:只验证最关键的因果链
不要先做“大一统世界模型”。第一阶段只回答:时序 JEPA 状态是否让 Goal Critic 更准?更准的 Critic 是否真的能让冻结的 VLA 更容易被纠偏?
| 模型 | 内容 |
|---|---|
| M0 | 单帧 Critic |
| M1 | 冻结 LeVJEPA 时序 Critic |
| M2 | M1 成立后加入 Goal Critic + Residual Actor |
| M3 | LeVJEPA 轻量适配:冻结 → 末 2 层微调 → 末 4 层 / LoRA,不默认全量微调 |
重点场景:滑移、接触转换、部分遮挡、延迟后果、失败的接近、物体状态改变、执行扰动。
训练目标
Goal Critic(Huber TD):
资源有限时可以先做成功分类器:
Residual Actor(最大化目标价值 + 最小干预):
四个 Go / No-Go 决策点
- 时序 Critic 成立吗? 若
在扰动、接触、遮挡场景都没有稳定优于 ,暂停 Residual / Memory 扩展,重新检查时序表征与控制的相关性。 - Critic 的提升能转化为策略提升吗? 若 Critic 更准但
,问题在修正接口或策略优化,而不在 Encoder。 - Goal-Value 选择能超过随机丢弃吗? 若
,就不能声称“选对 Token”有效。 - Memory / Foresight 对长时序有额外价值吗? 只在短时系统成立后再验证。
暂时不做的事
π0.5 全量微调;π0.5 LoRA + 全量 LeVJEPA 同卡训练;本地下载完整 DROID;从零训练大 LeVJEPA;大规模在线 RL;第一版就加 Mamba + 多步世界模型;多 backbone 全矩阵。云 GPU 只用于最终论文表格,不用于日常调试。
先证明“鲁棒世界表征 ≠ 精确控制表征”这个 mismatch 真实、可重复;再证明弱耦合的精度修正能补上缺口。不要一开始就把 Encoder、Critic、Residual、Token Selector、Memory 全部端到端耦合。