该研究探索用超网络在训练阶段生成固定 LoRA 适配器,将大规模事实注入目标语言模型。作者构建包含数千万多跳问答、覆盖 39 个领域的 MegaWikiQA,并系统考察超网络深度、宽度与目标模型规模对损失、推理准确率和 OOD 泛化的影响,报告各架构轴呈现可预测的幂律缩放,且大规模超网络在 OOD 评测中优于 LoRA 微调和全量微调。
最近 24 小时暂无可用热度快照。