全局蒸馏与局部微调:面向高阶推荐的推理蒸馏与测试时训练
原标题:Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation
升级推荐旨在识别更高品质的替代商品,在保留顾客购买意向的同时提供升级价值。大语言模型(LLM)具备对此类差异进行推理的能力,但将其直接应用于数以亿计的商品对在实际业务中并不切实际。我们提出了一种两级框架,将 LLM 的推理能力蒸馏到一个高效的非生成式学生模型中,并使其决策边界适应特定商品类型的升级标准。在第一级中,检索增强的少样本 LLM 教师模型生成结构化关系标签和自然语言推理依据。这些推理依据通过对齐和对比学习目标来监督紧凑的嵌入对分类器;在推理阶段,学生模型仅使用两个预先计算好的 768 维商品嵌入,无需调用 LLM 且无需生成文本。在包含 8,352 个商品对的固定人工标注基准上,参数量为 1550 万的四分类推理蒸馏学生模型达到了 0.924 的 AUC(95% 置信区间 [0.918, 0.929]),而仅使用标签训练的四分类学生模型 AUC 为 0.912。在第二级中,商品类型测试时训练(PT-TTT)利用少样本示例在冻结的学生模型上优化特定品类的轻量级适配器。PT-TTT 将 AUC 从 0.924 提升至 0.941,平均精度从 0.920 提升至 0.940。在包含 10 万对商品的代理目录上,单台 8 卡 GPU 机器上运行的蒸馏学生模型相比直接使用 LLM 推理,速度提升约 5,000 倍,预估成本降低约 10,000 倍。
为什么值得读
展示了如何将大模型的推理能力下放到毫秒级非生成式匹配场景,为高并发下的复杂意图识别提供了极具工业落地价值的蒸馏样板。