Skip to content
VLA#组会#LeVJEPA#SelectiveInvariance
Astraluster·2026-09-30·约 10 分钟·组会汇报稿 · 整理自 Notion

鲁棒 ≠ 精确:LeVJEPA 与短程精细控制的尺度错配 ​

这是一份组会稿

目标是用 8–10 分钟讲清楚一个问题,而不是展示一个“大系统”。目前还没有实验结果,只有 related work 支撑下的研究假设、概念方案和可证伪的问题。

核心句:“世界看得稳”和“动作做得准”,可能不是同一种表征能力。

鲁棒 ≠ 精确? ​

Robust Temporal Representation⇏Precise Short-Horizon Control

机器人控制同时需要两种能力:

世界表征需要“稳”精细控制需要“敏感”
遮挡后仍能识别状态2 mm 偏差可能决定插入成功还是碰撞
对背景、光照、无关 patch 不敏感几度姿态误差可能造成滑脱
理解物体运动与状态变化接触建立是瞬时、小尺度的变化
长时间动态保持一致当前局部误差必须被保留下来

研究矛盾在于:对 nuisance variation 的 invariance 越强,不代表对 control-critical variation 的 sensitivity 也越好。

为什么从 LeVJEPA 产生这个怀疑 ​

LeVJEPA 更适合被理解为一个 Temporal World-Prior Encoder:

Ztworld=ELeVJEPA(Ot−K:t)

关键观察:LeVJEPA 在激进的随机 token dropping 下仍能保持甚至提升 probing 表现。这说明 dense observation 中存在很强冗余,也说明它非常强调鲁棒、不变的时序表征。所以它天然适合回答 What is happening in the world?,却不一定天然回答 Exactly how should I move the robot by the next few millimeters?

对 nuisance 扰动,我们希望 ∥E(o+δn)−E(o)∥≈0;但对 control-critical 扰动,我们反而希望 ∥E(o+δc)−E(o)∥>0。

准确的说法

这里不是说“LeVJEPA 已被证明短程控制差”。准确的表述是:它的训练目标和实验结果让我有理由怀疑它的优势主要在 temporal robustness,而不是毫米级 control sensitivity——这个 mismatch 需要我们自己验证。

旧切入点为什么要调整 ​

最早的思路是 LeVJEPA→Goal Critic→Residual RL。方向本身没错,但最新工作让它不再适合做唯一创新点:

近邻工作已经覆盖的部分影响
WCM历史观测 + JEPA 式预测表征 + VLA Critic / RL“JEPA → Critic → VLA RL” 已高度拥挤
Physically Grounded JEPA逆动力学 + 状态对齐,让 latent 更 control-relevant“给 JEPA 做物理 grounding”已有近邻
Residual RL / VLaRL 类冻结 VLA,用 RL 做局部修正Residual RL 本身不是创新

所以问题被重新定义:不是“怎么把 JEPA + RL 拼起来”,而是——鲁棒世界表征与精细控制表征是否存在 temporal-scale mismatch?如果存在,应该在哪一层解决?

核心假设:Selective Invariance ​

H0 · Temporal-Scale Mismatch:LeVJEPA 的时序鲁棒性 / 不变性,不必然转化成短程控制精度。

希望 Encoder 满足:

{∥E(o+δn)−E(o)∥→0,δn: nuisance∥E(o+δc)−E(o)∥>0,δc: control-critical

概括为 Selective Invariance = Robustness + Control Sensitivity。候选目标:

LSI=Eδnd(E(o+δn),E(o))+λcEδc[max(0, m−d(E(o+δc),E(o)))]2

我追求的不是“越不变越好”,而是对无关变化不敏感、对控制关键变化保持敏感。

方案设想:主线看世界,辅线做修正 ​

  • 时序世界分支:视频历史 → LeVJEPA → Zworld,负责物体状态变化、运动趋势、遮挡与时序上下文;
  • 基础策略:当前观测 + 机器人状态 + 语言目标 → Base VLA → 名义动作 a0;
  • 目标导向辅线:Zworld + a0 + 目标 → Goal-conditioned RL → 精度修正 Δa。
at=at0+αtΔat

RL 辅线不是拟合固定的专家残差 Δat≠atGT−at0,而是根据“是否更接近完成任务”来修正:

Atcorr=Qg(ht, at0+αtΔat)−Qg(ht, at0)>0

第一版 reward:

rt=rttask+λp[γΦg(st+1)−Φg(st)]−λΔ∥Δat∥2

一句话:Base VLA 给出“应该怎么做”,RL 辅线只学“怎样以最小修改让它更可能完成目标”。 π0.5 只是 Base VLA 的一个候选实验载体,不是研究问题本身。

第一步:先证伪 H0 ​

第一阶段真正要做的实验只有一个——LeVJEPA 的时序鲁棒性,是否伴随短程控制敏感性的不足?

对比短程精度场景时序 / 鲁棒场景
单帧 / Base VLA 特征reaching、对齐、接触、插入滑移、遮挡、延迟后果、扰动
预训练 LeVJEPA 时序表征测 control sensitivity测 temporal robustness / 失败预判

希望看到的不是“LeVJEPA 处处更好”,而是 Gaintemporal>0,同时 Gainprecision≈0 甚至 <0。如果 H0 成立,再加入 Goal-conditioned Precision RL,看精度能否提升、同时保持时序鲁棒性。

这就是止损点:如果 H0 不成立,就不围绕 Selective Invariance 写论文,也不先烧算力去做 Residual、Mamba、World Model。

我想做成什么样的论文 ​

如果目标是 Pattern Recognition,主贡献不应该是“提出一个 JEPA + VLA + RL 系统”,而是一个表征学习问题:

Can a temporal representation remain invariant to nuisance variation while preserving sensitivity to control-critical variation?

证据链:发现 mismatch → Selective Invariance / 双尺度表征 → 目标导向的精度修正 → 机器人任务验证。 RL 是下游验证,而不是唯一创新。

我希望从组会得到的反馈 ​

  1. 这个 temporal robustness vs local precision 的 mismatch,值得作为论文核心问题吗?
  2. 第一阶段选哪些任务最容易把 mismatch 做干净——reaching、peg alignment、insertion、slip 还是 occlusion?
  3. 短程精度应该主要在表征层解决,还是让 Goal-conditioned RL 在策略层补偿?

这一阶段不追求“大而全”,先把一个清晰、可证伪、单 5090 就能完成的问题做扎实。

记得更少,但记住真正影响未来的东西。