Skip to content
世界模型#WorldModel#Mamba#VLA#TokenSelection
Astraluster·2026-09-28·约 18 分钟·整理自 Notion

记得更少,但记住真正影响未来的东西 ​

关于这篇笔记

这是一份持续维护的研究推演,不是论文成稿。下文会区分“当前假设”和“待验证问题”,目前还没有实验结论。

问题从哪里来 ​

最初的直觉很简单:短期看得细,长期记得远。用一个小 Transformer 处理局部短序列,对局部 Token 做筛选,只把有效 Token 放进 Mamba/SSM,让它建模很长时间尺度上的状态变化:

Xt:t+L→TransformerZt→SelectorZt∗→Mambaht

但很快发现一个问题:如果小 Transformer 自己承担“重要性筛选器”的角色,它很容易学到训练环境里的固定统计规律,而不是开放环境中真实的信息价值。于是问题收敛成了另一个形状:

在冻结的视频基础表征之上,能否只保留对未来预测和动作决策真正有价值的少量 Token,并通过 Mamba/SSM 维护一个可用于长期预测与动作条件想象的世界状态?

换句话说,我们关心的不是“如何记住更多历史”,而是:如何记得更少,但记住真正影响未来的东西。

Frozen Encoder→Predictive Token Selection→Selective Memory Write→Mamba State→Action-conditioned Dynamics

Token 的重要性不是静态的 ​

如果把重要性写成 si=f(zi),那它就是一个与任务、历史都无关的静态函数。可在具身任务里,同一个 Token 在不同任务阶段的价值完全不同。更合理的定义是:

st,i=f(zt,i, Pt, g, ht−1)

其中 zt,i 是当前视觉 Token,Pt 是世界知识先验,g 是任务目标,ht−1 是长期历史状态。Selector 真正要回答的是:

基于当前任务和已经知道的历史,这个信息现在还有没有必要被长期记住?

陌生信息不能因为“不熟悉”就被删掉 ​

如果 Selector 完全依赖训练分布,OOD 环境里真正关键的新物体、新状态反而可能被过滤。所以分数里不只要有任务相关性,还要考虑变化、新颖度、不确定性和与记忆的互补性:

st,i=αst,itask+βst,ichange+γst,inovelty+δst,iuncertainty+ηst,imemory

其中新颖度用来保护“没见过但可能重要”的信息:

st,inovelty=1−maxmj∈Mt−1sim(zt,i,mj)

先用好已有的视频表征 ​

LeVJEPA 给我的启发不是照搬它的完整框架,而是:先用已经具备较强时空表征能力的 Encoder,再在语义 Token 层做筛选。 这样 Selector 面对的不再是低级 RGB Patch,而是已经带有时空语义的 Token。

值得借鉴的三点:

  1. Per-frame Tokenization:保留每个 Token 的时间与空间归属,不过早做跨帧聚合;
  2. Block-Causal Attention:当前 Token 能看当前帧与历史帧,不能看未来帧,更符合在线机器人决策;
  3. Sparse-observation robustness:训练时大比例 Token 缺失,让 Encoder 对部分观测保持鲁棒。

Encoder 只负责回答 What is happening now?,而不承担长期记忆。

用“对未来的贡献”定义价值 ​

真正值得深入的创新点不是 Attention Top-K,而是:一个 Token 的价值,应由它对未来世界预测和后续动作的贡献来定义。

Vt,ipred=Lfuture(−i)−Lfuture

去掉第 i 个 Token 后,未来预测损失上升得越多(Vt,ipred≫0),它就越值得被记住。研究对象因此从 Important Token Selection 转向 Predictive Token Selection——一种近似的 Value of Information:保留这条信息,能否显著改善未来状态预测、动作生成或长期任务成功率?

hₜ10 / 50 tokens
保留了约 51% 的“预测价值”
交互演示 · 只把预测价值最高的 Token 写入长期状态(score 为示意数据)

记“变化”,而不是记“画面” ​

连续 100 帧里都有同一把锤子,没必要把“锤子存在”写入 100 次。真正值得长期保存的是:手接近工具、抓取建立、工具被抬起、工具与目标接触、目标状态改变、遮挡发生、关键物体重新出现。

于是把 Token 表征进一步转化为“变化 Token”:

Δzt,i=EΔ(zt,i, zt−1,j∗),j∗=arg⁡maxjsim(zt,i,zt−1,j)

长期模型接收的不再是完整视觉快照 Z1,…,ZT,而是稀疏的世界变化 ΔZ1∗,…,ΔZT∗。这更接近 Event-level World State Modeling,而不是普通的视频压缩。

Mamba 是一台长期状态机 ​

Mamba 不再被理解成“替代 Transformer 的长序列模块”,而是维护选择性长期世界状态的状态机:

ht=FMamba(ht−1, ΔZt∗)

ht 主要编码关键对象的长期状态、物体是否已被操作、工具与目标的关系、过去动作的结果、被遮挡但仍应存在的世界状态,以及当前任务阶段。它还会反过来参与下一时刻的选择,形成闭环:

Memory→Selection→Memory Update

光有记忆还不够 ​

仅有长期记忆,还不能严格称为世界模型。关键在于回答:如果现在执行动作 at,世界接下来会发生什么?

(ht,at)→h^t+1

加上 action-conditioned dynamics 之后,它才从“长期记忆模块”升级成 Selective Latent World Model。

不可微的选择与长程信用分配 ​

当前最大的理论难点之一:硬选择 mt,i=1(st,i>τ) 几乎处处梯度为 0。第一版更适合用 Soft Gate:

python
# s: token 分数, tau: 阈值, T: 温度
p = torch.sigmoid((s - tau) / T)
z_tilde = p.unsqueeze(-1) * z        # 软选择,保留梯度
h_t = mamba(h_prev, z_tilde)          # 写入长期状态
# 待消融:温度退火 / Straight-Through / Gumbel-Softmax / Hard Top-K

此时 ∂z~t,i∂st,i=zt,i1Tpt,i(1−pt,i),会带来温度、饱和与梯度消失问题。

更深一层:当前是否保留某个 Token,会影响很久以后的状态(st→Zt∗→ht→st+1),所以这不只是分类问题,而是 Long-term Credit Assignment——未来的 loss 需要回头告诉早期的 Selector:“你当时删掉它,是对是错?”

受限算力下的训练路线 ​

不具备从头训练大规模世界模型的算力,所以分阶段解锁:

阶段内容要回答的问题
Stage 0冻结基础 Encoder,离线缓存 Token—
Stage 1只训练 Selector + Dynamics少量 Token 是否足以预测未来?
Stage 2加入 Mamba 长期状态,测 k=1,4,8,16,32长期状态能否支撑多步预测?
Stage 3Memory-conditioned Selection历史能否改善当前写入?
Stage 4加入 World PriorOOD 泛化是否提升?

三个待验证的假设 ​

编号假设
H1Token 的价值由它对未来 action-conditioned 预测的贡献决定,而非静态显著性或 Attention Score。
H2长期记忆的基本单位应是 Patch / Object / Event 级的世界变化,而不是完整帧。
H3在长时序、遮挡、OOD、任务阶段切换场景中,稀疏的长期状态可能优于保存全部历史。

Benchmark 的目标不是和大模型拼参数,而是比较 Performance vs Token Budget / Compute / History Length。最理想的现象是:

Performance20%≈Performance100%

如果在 OOD / long-horizon 场景里甚至 Performance20%>Performance100%,那将支持一个重要结论:长期世界建模的瓶颈,未必是信息不足,而可能是历史冗余。

创新风险 ​

如果最终只是“LeVJEPA + Token Selector + Mamba”,创新风险已经比较高。需要逐篇拆清楚 EventVLA、Chronos、AEM、NativeMEM、MemoryVLA++、MaP-WAM、V-JEPA 2-AC 等近邻工作的差异。真正需要证明的是:

未来 dynamics prediction 能否反向定义当前 Token 的信息价值,并据此形成更高效、更鲁棒的长期世界状态。

一句话定义: 一种建立在冻结视频基础表征之上的选择性潜空间世界模型——通过未来预测价值决定哪些局部世界变化值得写入 Mamba/SSM 长期状态,并利用 action-conditioned dynamics 想象未来,最终服务于长期具身决策。

记得更少,但记住真正影响未来的东西。