CIFAR-10 上的经典联合能量模型:失败模式与 PC、SGLD 采样器的实际难分性
原标题:Canonical Joint Energy-Based Model on CIFAR-10: failure modes and practical indistinguishability of Predictor-Corrector and SGLD samplers
联合基于能量的模型(JEM)在单个网络中统一了分类与生成,并支持分布外(OOD)检测。经典 JEM 训练依赖随机梯度朗之万动力学(SGLD);一种具有理论依据的替代方法,即预测器-校正器(PC)采样器,此前尚未在经典模型上经过系统性复现实验。我们在两个独立运行中,于不含归一化层的 WideResNet-28-10 上复现经典 JEM,并测试在不采用退火噪声调度的情况下,PC 是否仍保有其理论优势,实验涵盖三种方案:在约 130 个训练周期中始终用 PC 替代 SGLD;冷启动生成(FID);以及细化式多 OOD 检测(AUROC)。复现结果达到 92.88% 的测试准确率和 44.46 的缓冲区 FID(经典结果分别为 92.9% 和 38.40)。我们记录了两种失败模式:通过经典异常值缓冲区机制导致的训练后期灾难性发散(两个 SGLD 运行以及具有相同特征的两个 PC 运行均出现该问题),以及与运行过程相关的 SVHN OOD 判别动态。在任何方案上都未观察到 PC 相较于 SGLD 的方法级优势:在推理阶段,所有十个检查点-OOD 配对中的绝对 AUROC 差异均低于 0.007,FID 差异低于 0.5;在训练方案中,分层的“随机种子-图像”自助法得到的宏平均 AUROC 差异 95% 置信区间包含零,而每种方法仅进行两次运行的种子级等效性检验无法确立形式上的等效性。数据既与两者等效相符,也与存在微小方向性效应相符。这种实践上的不可区分性在理论上是预期之中的:在固定噪声下,PC 的预测器步骤按构造会退化,因此其理论保证无法迁移到经典 JEM。
为什么值得读
JEM 复现与采样器选择仍影响生成和 OOD 结论;本文用失败案例与有限统计证据重新限定了 PC 理论优势的适用范围。