机器人规划路线时,两个画面“看起来很像”,不等于它们离目标同样近。Temporal-Distance JEPA想补上这把进度尺:让模型直接判断从当前状态到目标大约还要多少步,而不是只比较两幅画面的内部编码有多相似。
它沿用JEPA——一种不重建每个像素、只预测抽象状态变化的世界模型——并从无奖励的示范轨迹中学习时间距离。同一条轨迹里的先后顺序提供“还差几步”的信号;不同轨迹的状态配对则作为启发式反例,避免模型误判捷径。它还加入与规划步数相匹配的一致性约束。由于“从A到B”和“从B到A”未必一样难,这个距离是有方向的。
这项设计尤其贴近模型预测控制:模型先想象多种动作路线,只执行其中一小步,再根据新观察重新规划。作者称,在导航、到达等重视路径结构的任务中,可直接用时间距离选路线;在推物体等依赖接触几何的任务中,则保留欧氏距离,但让时间监督改善潜在表示。原文所给摘要缺失具体成绩数字,因此这里只保留其定性结论。