Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
PAPER HF 58 约 7 分钟

JEPA-Anything:一种预测法跨越不同世界

把预测拆成互补因子,JEPA-Anything试图用同一原则理解图像、病程、分子与天气。

你让一个 AI 同时预测台球的运动、病人的下一次临床事件和分子的长期变化,它通常需要三套不同的办法。JEPA-Anything 追问的是:这些“世界”虽然表面完全不同,背后能否共享一种预测原则?它不要求图像、病历和分子使用同一种编码器,而是把预测的核心步骤统一起来。值得现在看,正因为它尝试把 JEPA 从一种专用架构,推向一种跨领域的世界建模原则。

这里的 JEPA,全称是 Joint-Embedding Predictive Architecture。它不直接猜下一张图的每个像素,而是在表征空间——模型把复杂输入压缩成内部数字后形成的抽象空间——预测未来状态。就像判断“球会滚到桌边”,不必先画出球面上的每一道纹理。

论文作者把这套方法用于视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。不过,目前证据全部来自作者团队的论文及配套项目,尚无外部独立验证。下文数字也只代表论文给定的数据、指标和对照设置。

不让所有规律挤在一条路上

标准 JEPA 通常把目标压成一个整体表示,再交给一条预测路径。问题在于,一个世界往往同时包含多种变化:物体在哪里、发生了什么操作、哪些部分变化快、哪些部分变化慢。若它们都挤进同一个目标,容易预测或波动较大的结构可能占据主要学习容量,较弱的规律则会被盖住。

JEPA-Anything 的关键是 orthogonal predictive factorization,简称 OPF,可译作“正交预测因子分解”。它把目标的潜在表示拆到若干互补子空间,让专门的预测路径分别学习,再把结果拼回完整状态。

可以把它想成几位分工明确的观察员:每个人负责记录不同侧面,最后合成一份完整报告。“正交”约束要求他们尽量不要重复记录同一件事;活动度约束则防止某位观察员彻底闲置。模型还会抑制编码器坍塌——也就是无论输入什么,都给出近似相同表示的失败状态。

这些因子由数据学出来,并不天然对应“温度”“位置”或“速度”等人能命名的变量。论文真正主张的是一种容量组织方式:把复杂预测拆开学习,同时保持各部分能够稳定重组。

统一的是原则,不是整台机器

“Anything”很容易让人误以为同一个模型原封不动地处理所有数据。论文实际划出的边界更克制。

每个领域仍需自己的适配器、输入切分方式和编码器。图像可以使用视觉 Transformer,分子可以使用图结构模型,临床记录可以使用序列模型。各领域还要自行规定“已知什么、要预测什么”:可能是遮住的图像区域、病人的未来状态,也可能是接受干预后的细胞状态。

统一的是后半段:目标表示如何分解、各因子如何预测、如何避免重叠与失活,以及怎样重新合成完整状态。换句话说,它更像一套通用的预测语法,而不是一台什么都能直接吞进去的万能机器。

合成后的状态有两种用途。一种是在预测结束后接一个任务读出器,例如判断细胞类型或估计临床事件风险。另一种更接近“世界模型”:把预测结果重新送回模型,连续推演多步未来。后者更难,因为每一步的小误差都会传给下一步。

哪些结果最能说明问题?

论文设置了 10 个条件匹配的动态任务。所谓“匹配”,是标准 JEPA 与 JEPA-Anything 使用相同数据、编码器、训练预算和评估划分,主要差别是整体预测与因子化预测。按作者报告,JEPA-Anything 在这 10 项任务的相应指标上全部改善。但这不等于它全面超过所有现有方法,只能说明在论文选定的对照中,因子化设计表现更好。

Interventional Pong 的结果更直观。这个简化的 Pong 环境会人为改变一个或多个底层状态,模型看到改变前的画面和干预标签,再预测下一状态。相较密集的标准 JEPA,JEPA-Anything 将单一干预的一步均方误差从 0.009541 降至 0.006218,降幅为 34.83%;未在训练中出现的组合干预,误差下降 12.90%;连续自由推演六步时,误差下降 8.58%。增益随预测链拉长而缩小,但没有立刻消失。

物理场实验也展示了误差累积的差别。在 PDEBench 的 Burgers 任务中,标准 JEPA 的第六步误差为 0.006369,JEPA-Anything 为 0.004014;浅水系统中则从 0.010510 降至 0.006522。另一组最长 50 步的 Burgers 实验仍有改善,不过论文明确显示,优势从第 20 步到第 50 步有所收窄。

在单细胞任务上,JEPA-Anything 的 PBMC 零样本聚类 AvgBIO 为 0.7752,高于匹配的 Cell-JEPA 的 0.7194;Norman 扰动反应预测的 Pearson 相关系数从 0.787升至 0.814。临床实验则预测超过 1,000 个未来事件风险,作者称平均 PRAUC 高于整体式 JEPA,但所给材料没有披露具体数值,“1,000 个事件”的统计口径也不够明确。

为什么值得关注?

真正有意思的,不是七个领域排成一长串,而是论文提出了一个可检验的中间命题:跨领域世界建模也许不需要共享输入形式,却可以共享“如何分配预测容量”的原则。

它还把因子坐标用作分析接口。作者报告,在四个分子系统中,该方法的一步和 100 步误差均低于论文比较的方法;模型提名的一项生物干预,也在细胞共培养、患者来源类器官、肿瘤组织片段和小鼠实验中获得支持。轨道分析中,潜在模式恢复出的 Keplerian scaling exponent 拟合斜率为 -1.4991。这些结果把模型从“预测得准不准”推进到另一个问题:学到的内部结构能否帮助提出实验假设,或重新显露已知物理规律。

但“共同原则”目前仍是一项有力假说,而不是已经证明的普适定律。七个领域展示了跨度,却不能代表任意世界;因子能够辅助分析,也不意味着每个因子都有清晰、固定的人类语义。

局限与未知

  • 所有结果均来自同一作者团队,尚无独立复现。生物实验支持不能外推为人体临床有效。
  • 跨领域共用的是 OPF 核心,各领域仍需要专门的适配器、编码器和任务定义,因此“领域无关”不等于零改造迁移。
  • 论文展示了多项优势,但长程预测的增益会收窄,临床事件口径及部分实验细节也未在所给材料中完整披露。代码仓库已随论文给出,但许可证、可复现性和实际公开状态未获独立核验。

供稿材料 SOURCES — 1

← 返回 2026-09-21 · 学术板块