Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Siliang Liu·2026年9月4日 17:08

全局蒸馏与局部微调:面向高阶推荐的推理蒸馏与测试时训练

原标题:Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation

论文74

升级推荐旨在识别更高品质的替代商品,在保留顾客购买意向的同时提供升级价值。大语言模型(LLM)具备对此类差异进行推理的能力,但将其直接应用于数以亿计的商品对在实际业务中并不切实际。我们提出了一种两级框架,将 LLM 的推理能力蒸馏到一个高效的非生成式学生模型中,并使其决策边界适应特定商品类型的升级标准。在第一级中,检索增强的少样本 LLM 教师模型生成结构化关系标签和自然语言推理依据。这些推理依据通过对齐和对比学习目标来监督紧凑的嵌入对分类器;在推理阶段,学生模型仅使用两个预先计算好的 768 维商品嵌入,无需调用 LLM 且无需生成文本。在包含 8,352 个商品对的固定人工标注基准上,参数量为 1550 万的四分类推理蒸馏学生模型达到了 0.924 的 AUC(95% 置信区间 [0.918, 0.929]),而仅使用标签训练的四分类学生模型 AUC 为 0.912。在第二级中,商品类型测试时训练(PT-TTT)利用少样本示例在冻结的学生模型上优化特定品类的轻量级适配器。PT-TTT 将 AUC 从 0.924 提升至 0.941,平均精度从 0.920 提升至 0.940。在包含 10 万对商品的代理目录上,单台 8 卡 GPU 机器上运行的蒸馏学生模型相比直接使用 LLM 推理,速度提升约 5,000 倍,预估成本降低约 10,000 倍。

为什么值得读

展示了如何将大模型的推理能力下放到毫秒级非生成式匹配场景,为高并发下的复杂意图识别提供了极具工业落地价值的蒸馏样板。

标签

推荐系统知识蒸馏测试时训练RecSysDistillationTest-Time Training

评分依据

  • 新颖性70
  • 影响力76
  • 实践价值86
  • 可信度75
  • 时效性70