JEPA / 交互学习笔记← 返回 Apps
2022 → 2026 · 沿着问题学习

从一块图像,
走到行动的后果。

每一站先看上一代留下的问题,再动手试一个例子。重点是理解训练目标如何变化,以及实验究竟验证了什么。

这条路线选取与你关心的机器人控制最相关的工作,不是 JEPA 全部论文的年表。2-AC 与 V-JEPA 2 属于同一篇论文;JEPA-VLA 是后续应用分支。
第 1 / 6 站已标记理解 0 / 6
01 / 2022 / 架构提案

JEPA:预测什么,才值得学?

看见杯子在桌上,并不需要先猜准桌布每条纹理。JEPA 把预测目标放在可学习的表征空间,希望在保留信息与容易预测之间找到平衡。

换桌布、移动杯子:哪种变化被保留?

手工构造的示意表征;没有运行模型

输入画面

抽象表征的可读示意

换纹理时,示意表征保持不变;移动杯子时,位置会变化。

编码器决定保留什么

x 与 y 可以是相关的观察。编码器把它们变成 sₓ、sᵧ;预测器根据 sₓ 推断 sᵧ。预测误差在向量之间计算。图中的“位置、支撑”只是解释向量的一种方式,实际特征没有预设字段。

不能把“忽略细节”推到极端

若所有输入都变成同一个向量,预测就很容易,但表征毫无用处。原始提案同时要求保留输入信息、降低预测误差,并限制额外变量 z 的信息容量。原文图 13 ↗

检查一种“作弊解”

杯子 → [0.8, 0.2, 0.5]
小狗 → [0.1, 0.9, 0.3]
汽车 → [0.4, 0.3, 0.9]

这些示意向量能区分不同输入。点击按钮,看看为什么仅靠匹配误差还不够。

原版的 z 和 H-JEPA 是什么?

z 可以表达仅凭 x 无法确定的分支,例如车在岔路口向左或向右。它的容量需要受限,否则预测器可以直接从 z 复制答案。H-JEPA 则设想:低层预测短期细节,高层用更粗的状态预测较长时间。这是 2022 年提案中的方向,不代表当时已完成通用规划系统。

这一站的证据层级:研究提案。提出了架构与训练原则;下一站需要回答它能否实际学出有用的视觉特征。LeCun 2022,§4.4–4.6 ↗