Skip to content
世界模型#JEPA#RL#表征学习
Astraluster·2026-10-08·约 14 分钟·整理自 Notion

预测相近 ≠ 结果相近:给 JEPA 表征定义“控制等价类” ​

当前状态

研究已从“单纯修改 JEPA Encoder”转向“鲁棒任务可行性保持的表征学习”候选原则:冻结 π₀.₅,通过统一的轻量 Adapter 验证表征对真实控制的贡献。下文保留的是研究演进过程,公式和方案都不代表已锁定的最终方法,目前尚未开展实验。

重新定位问题 ​

最初的想法是:用强化学习的长程任务成功信号,帮 JEPA 学到更适合机器人控制的 latent representation,从而提升 VLA 的控制精度与鲁棒性。

梳理之后,问题被重新定义为:

JEPA 的 predictive latent,是否真正保留了对机器人长期控制任务关键的信息?

核心假设只有一句话:

Predictive similarity does not necessarily imply control-outcome similarity.

两个状态在 JEPA 潜空间里可能非常接近,但实际执行之后,可能产生完全不同的任务结果。

预测空间 ≠ 控制结果空间 ​

JEPA 类世界模型主要优化未来预测:LJEPA=Lprediction。可机器人控制关心的是任务的最终结果——是否完成、长程 reward、成功或失败、鲁棒性。于是存在一个潜在的 representation gap:

Predictive Space≠Control Outcome Space

但解决办法不是把所有信息硬塞进同一个点。需要区分两层表征:

  1. World Predictive Latent zworld:保留真实动力学与状态差异,用于未来预测;
  2. Goal-conditioned Control Representation cctrl:表达不同策略在任务意义上是否等价。

目标是:从 predictive latent 中学习一个由任务结果定义的“控制等价几何”,同时不破坏世界预测所需的信息。

原方案的问题 ​

原方案想通过 RL 找“更优的 latent”,可能引入候选动作选择、轨迹重排序、执行器、规划模块……这很容易偏向控制系统设计,而不是世界模型的表征学习。

新方案不额外设计复杂执行器,而是在表征层研究:

如何利用长期任务 outcome 定义“策略等价关系”,并让这种等价关系反向塑造 JEPA 的预测表征。

一个需要避开的误区

不是要求所有成功轨迹的原始 world latent 都收敛到同一点。原始 world latent 仍需区分位置、速度、接触等动力学状态;真正需要收敛的,是任务条件下的 control-equivalence representation。

策略等价关系 ​

真正要定义的是:什么样的不同策略,在任务意义上应该被视为同一类?

对同一目标 g,两条轨迹 τi、τj 即使动作序列不同,只要同时满足:最终都完成任务、不违反物理/安全约束、执行成本都在可接受范围、没有明显冗余动作或异常耗时——就定义它们在任务 g 下控制等价:

τi∼gτj

研究目标因此不是寻找唯一最优策略,而是学习一组结果等价、执行合理的策略等价类。

收敛的应该是“未来”的表征,而不是某一时刻的状态 ​

两条都成功的策略,执行过程中的物理状态可能完全不同,不能强制 zt,iworld=zt,jworld,否则会把任务进度和动力学状态一起压掉。

更合理的对象是 action-conditioned future / trajectory representation。先由 JEPA 得到:

zt=Eθ(o≤t),z^t+1=Fϕ(zt,at)

再由一个低容量、任务条件化的映射得到控制表征:

ci=Pψ(A(z^t:t+H(i), at:t+H(i)), g)

其中 A 是对短期预测片段或整条轨迹的聚合,具体形式待实验决定。对控制等价的策略,要求 τi∼gτj⇒ci≈cj。

直观地说:World Latent 保留“世界具体发生了什么”;Control Representation 表达“这些不同的行为是否属于同一个有效的策略等价类”——可以理解为从世界潜空间诱导出一个 Goal-Conditioned Control-Equivalent Quotient Representation。

几何约束:收敛、分离与“合理的成功” ​

等价策略吸引项——让“策略不同、但都成功且执行合理”的轨迹聚到一起:

Leq=E(i,j)∈Pg[∥ci−cj∥22]

非等价策略分离项——失败、碰撞、明显低效或结果显著不同的 pair,按结果差异拉开:

Lsep=E(i,j)∈Ng[max(0, mij−∥ci−cj∥2)2],mij=αdoutcome(i,j)

执行成本——5 秒完成和绕行 60 秒才完成,不应被完全等价看待:

C(τ)=αTT+αA∑t∥at∥+αΔA∑t∥at+1−at∥+αVCviolation

合理成功集合为 Fg={τ:S(τ,g)=1, C(τ)≤Cmax},只有同属 Fg 的轨迹才进入同一等价类。完整目标:

L=Lpred+λeqLeq+λsepLsep+ηLreg

重点不是“多加几个 loss”,而是从策略等价关系出发,定义控制空间应满足的几何结构:等价策略收敛,不等价策略分离,世界动力学差异仍由 zworld 保留。

VLA 在其中的位置 ​

VLA(如 π 系列)不是创新模块,而是应用载体:提供动作生成能力、真实控制 rollout 和任务 outcome 数据。要研究的是:

动作变化 → 世界模型预测 → latent 变化 → 最终任务结果

而不是让世界模型直接替代执行器。

下一步要验证什么 ​

A. Control-Outcome Aliasing 是否存在? 验证 d(zi,zj)≈0 是否可能对应 |Gi−Gj|≫0。如果成立,说明普通 predictive latent 会混淆控制结果显著不同的未来。

B. 多策略成功等价是否有稳定结构? 收集同一任务下动作不同、但都满足成功与效率约束的轨迹,检查控制表征能否把等价成功策略聚到一起,同时确认世界预测精度、状态可辨识性没有明显下降,再验证它是否真的提升 VLA 在视觉扰动、位置偏差、接触误差和 OOD 条件下的鲁棒性。

当前最关键的未决问题不是继续加网络,而是先把**“等价关系作用在哪一级表征”**定义清楚:单步 transition、H 步 future segment,还是完整轨迹?Pψ 是否只在训练时使用、如何限制容量,确保梯度真正塑造 Encoder/Predictor,而不是被 projection head 自己吸收?

我们不是在学习唯一最优策略,而是在学习任务条件下的控制等价类:不同但合理的成功策略,应当在控制表征中收敛到同一处。

记得更少,但记住真正影响未来的东西。