记得更少,但记住真正影响未来的东西
关于这篇笔记
这是一份持续维护的研究推演,不是论文成稿。下文会区分“当前假设”和“待验证问题”,目前还没有实验结论。
问题从哪里来
最初的直觉很简单:短期看得细,长期记得远。用一个小 Transformer 处理局部短序列,对局部 Token 做筛选,只把有效 Token 放进 Mamba/SSM,让它建模很长时间尺度上的状态变化:
但很快发现一个问题:如果小 Transformer 自己承担“重要性筛选器”的角色,它很容易学到训练环境里的固定统计规律,而不是开放环境中真实的信息价值。于是问题收敛成了另一个形状:
在冻结的视频基础表征之上,能否只保留对未来预测和动作决策真正有价值的少量 Token,并通过 Mamba/SSM 维护一个可用于长期预测与动作条件想象的世界状态?
换句话说,我们关心的不是“如何记住更多历史”,而是:如何记得更少,但记住真正影响未来的东西。
Token 的重要性不是静态的
如果把重要性写成
其中
基于当前任务和已经知道的历史,这个信息现在还有没有必要被长期记住?
陌生信息不能因为“不熟悉”就被删掉
如果 Selector 完全依赖训练分布,OOD 环境里真正关键的新物体、新状态反而可能被过滤。所以分数里不只要有任务相关性,还要考虑变化、新颖度、不确定性和与记忆的互补性:
其中新颖度用来保护“没见过但可能重要”的信息:
先用好已有的视频表征
LeVJEPA 给我的启发不是照搬它的完整框架,而是:先用已经具备较强时空表征能力的 Encoder,再在语义 Token 层做筛选。 这样 Selector 面对的不再是低级 RGB Patch,而是已经带有时空语义的 Token。
值得借鉴的三点:
- Per-frame Tokenization:保留每个 Token 的时间与空间归属,不过早做跨帧聚合;
- Block-Causal Attention:当前 Token 能看当前帧与历史帧,不能看未来帧,更符合在线机器人决策;
- Sparse-observation robustness:训练时大比例 Token 缺失,让 Encoder 对部分观测保持鲁棒。
Encoder 只负责回答 What is happening now?,而不承担长期记忆。
用“对未来的贡献”定义价值
真正值得深入的创新点不是 Attention Top-K,而是:一个 Token 的价值,应由它对未来世界预测和后续动作的贡献来定义。
去掉第
记“变化”,而不是记“画面”
连续 100 帧里都有同一把锤子,没必要把“锤子存在”写入 100 次。真正值得长期保存的是:手接近工具、抓取建立、工具被抬起、工具与目标接触、目标状态改变、遮挡发生、关键物体重新出现。
于是把 Token 表征进一步转化为“变化 Token”:
长期模型接收的不再是完整视觉快照
Mamba 是一台长期状态机
Mamba 不再被理解成“替代 Transformer 的长序列模块”,而是维护选择性长期世界状态的状态机:
光有记忆还不够
仅有长期记忆,还不能严格称为世界模型。关键在于回答:如果现在执行动作
加上 action-conditioned dynamics 之后,它才从“长期记忆模块”升级成 Selective Latent World Model。
不可微的选择与长程信用分配
当前最大的理论难点之一:硬选择
# s: token 分数, tau: 阈值, T: 温度
p = torch.sigmoid((s - tau) / T)
z_tilde = p.unsqueeze(-1) * z # 软选择,保留梯度
h_t = mamba(h_prev, z_tilde) # 写入长期状态
# 待消融:温度退火 / Straight-Through / Gumbel-Softmax / Hard Top-K此时
更深一层:当前是否保留某个 Token,会影响很久以后的状态(
受限算力下的训练路线
不具备从头训练大规模世界模型的算力,所以分阶段解锁:
| 阶段 | 内容 | 要回答的问题 |
|---|---|---|
| Stage 0 | 冻结基础 Encoder,离线缓存 Token | — |
| Stage 1 | 只训练 Selector + Dynamics | 少量 Token 是否足以预测未来? |
| Stage 2 | 加入 Mamba 长期状态,测 | 长期状态能否支撑多步预测? |
| Stage 3 | Memory-conditioned Selection | 历史能否改善当前写入? |
| Stage 4 | 加入 World Prior | OOD 泛化是否提升? |
三个待验证的假设
| 编号 | 假设 |
|---|---|
| H1 | Token 的价值由它对未来 action-conditioned 预测的贡献决定,而非静态显著性或 Attention Score。 |
| H2 | 长期记忆的基本单位应是 Patch / Object / Event 级的世界变化,而不是完整帧。 |
| H3 | 在长时序、遮挡、OOD、任务阶段切换场景中,稀疏的长期状态可能优于保存全部历史。 |
Benchmark 的目标不是和大模型拼参数,而是比较 Performance vs Token Budget / Compute / History Length。最理想的现象是:
如果在 OOD / long-horizon 场景里甚至
创新风险
如果最终只是“LeVJEPA + Token Selector + Mamba”,创新风险已经比较高。需要逐篇拆清楚 EventVLA、Chronos、AEM、NativeMEM、MemoryVLA++、MaP-WAM、V-JEPA 2-AC 等近邻工作的差异。真正需要证明的是:
未来 dynamics prediction 能否反向定义当前 Token 的信息价值,并据此形成更高效、更鲁棒的长期世界状态。
一句话定义: 一种建立在冻结视频基础表征之上的选择性潜空间世界模型——通过未来预测价值决定哪些局部世界变化值得写入 Mamba/SSM 长期状态,并利用 action-conditioned dynamics 想象未来,最终服务于长期具身决策。