统一的是配方,不是数据与模型

来自PhAI Labs、香港中文大学、复旦大学、斯坦福、牛津和普林斯顿的研究团队提出了JEPA-Anything:一种面向多领域世界模型的训练框架。它关注的问题是,视觉、生物、临床轨迹、控制、分子动力学、物理场和天气等任务,是否能沿用同一套预测学习方法,而不必为每个领域重新设计核心架构。

这项工作的变化值得读,不是因为它宣称所有领域已经可以由一个模型处理,而是因为它把改进点放在JEPA内部的表示与预测关系上。论文报告称,在七个领域的测试中,JEPA-Anything在十项匹配的动力学任务上都改善了指标;但具体领域仍使用各自的分词方式、编码器或适配器,因而“统一”主要发生在核心学习机制,而非整个系统栈。

单一预测头为何会挤压弱信号

标准JEPA通常包含上下文编码器、指数移动平均(EMA)目标编码器和一个预测器。预测器要从上下文表示推断目标表示,最后输出一个整体的潜变量。研究团队将这里的困难称为容量分配问题:高方差结构容易主导学习,而较弱的变化模式可能受到相互冲突的梯度影响,难以获得稳定、独立的预测能力。

JEPA-Anything用正交预测因子分解(OPF)改变这套分工。它将宽度为d的目标潜变量拆成K个宽度为r的子空间,满足d=K×r;多数实验采用K=4,每个因子各有一个预测器。模型将这些预测结果通过投影矩阵的Moore–Penrose伪逆重新组合,得到供解码、规划或滚动预测使用的完整潜状态。也就是说,分解发生在预测路径上,最终仍然要回到一个可用的整体状态。

正交约束不只是整齐的数学形式

把预测目标切成几块,并不自动保证每块学到不同内容。OPF加入三类约束来控制这个问题:正交损失让单个投影器内部的列向量正交、不同投影器占据不重叠子空间;因子活性损失通过每个坐标的标准差设置铰链约束,避免某个因子失活;编码器方差损失则直接向在线编码器提供防坍塌信号。OPF损失被加到各领域原有训练目标中,而不是替换它们。

CITRIS Interventional Pong上的机制审计提供了一个具体证据。在五组配对随机种子下,容量匹配但不加正交约束的多头模型条件数为438.52,正交版本为1.00005,因子间重叠接近零。条件数差异说明,预测结果合成时的数值稳定性并非无关紧要的实现细节;不过,这一结果来自特定任务和实验设置,不能单独证明所有领域都能获得同样的稳定性收益。

成绩分布比总排名更能说明问题

结果覆盖了不同类型的预测目标。在单细胞数据上,零样本PBMC聚类的AvgBIO从Cell-JEPA的0.7194升至0.7752,Norman扰动预测的Pearson相关系数从0.787升至0.814;在UK Biobank超过一千项临床事件的预测中,平均PRAUC从匹配标准JEPA的0.711升至0.718。这些结果支持OPF对终端读出任务有帮助,但幅度和指标随任务而异,不能简单归结为所有下游任务都获得同等提升。

对世界模型更直接的证据来自动态预测。CITRIS Interventional Pong的单次干预均方误差下降34.83%,未见过的组合干预改善12.90%,六步自由滚动改善8.58%;APEbench Burgers的六步滚动误差约下降44.7%,并且每个随机种子都改善。研究还报告,采用TrajCast风格骨干进行100步分子滚动时,水、石英、对乙酰氨基酚和苯的MAE与RMSD均取得最低值。与此同时,规划不是全面胜利:在参数量相差不超过0.3%的比较中,CEM回报在Walker2d和HalfCheetah上更好,Hopper则由标准JEPA领先。

对工程团队,复用边界比通用口号重要

这套设计对技术负责人的实际启发,是可以把“换领域”与“改核心预测机制”分开评估。若团队已有特定领域的编码器和训练目标,OPF作为可叠加的预测分解机制,提供了一条不必推倒原有管线的实验路径;研究材料还指出,核心实现以OrthogonalFactorProjection形式暴露,领域适配器负责分词和编码。工程上应把因子数、正交性与活性约束的额外训练成本,以及重组环节的数值行为,一并纳入评估,而不能只看最终分数。

证据也留下明确边界。七个领域的覆盖展示了同一配方在多类任务上的可迁移性,却没有消除领域适配,也没有证明同一组参数、表征和数据能够跨领域直接复用。临床指标的小幅上升、干预预测的大幅改善和规划中的反例,回答的是不同问题。更稳妥的工程判断是:当单一潜变量预测器可能让弱动态模式被高方差结构压过时,值得将OPF作为匹配容量的对照方案测试;是否采用,则应由本领域的干预、长时滚动和下游决策指标共同决定。