大语言模型的特定领域幻觉检测与对齐反馈
原标题:Domain-Specific Hallucination Detection in Large Language Models
大型语言模型生成的流畅文本中可能包含不真实的主张——这一现象被称为幻觉。我们提出了一种多信号检测流程,结合了微调的 DeBERTa-v3 分类、蒙特卡洛(MC)Dropout 不确定性量化以及温度缩放校准,用于回复级别的幻觉检测。在 HaluEval 基准上的评估结果显示,我们的流程在通用领域任务上达到了 F1=0.915 和 AUROC=0.977,各项任务的 F1 分数分别为 0.97(问答)、0.96(摘要)和 0.82(对话)。MC Dropout 推理进一步将准确率提升至 93.2%。上下文消融实验证实,该模型执行的是真正的蕴涵推理,而非利用表面模式;当移除知识上下文时,摘要任务的 F1 分数下降了 24%。学习曲线分析表明,使用 25% 的训练数据即可达到全量数据 77% 的性能。除检测之外,我们还将直接偏好优化(DPO)应用于 Qwen2.5-0.5B 生成器,经我们的检测器测量,其幻觉率从 85.5% 降低至 37.7%(相对降低 55.9%)。在 SciFact 生物医学基准上的跨领域评估表明,通用领域训练的迁移效果较差(F1=0.52),这促使了特定领域微调的需求。在 SciFact 上微调的 PubMedBERT 达到了 F1=0.63 和 AUROC=0.81,表明领域匹配的预训练是最有效的适应策略。代码和模型可在 https://github.com/varunteja99/hallucination-detection-nlp 获取。
为什么值得读
论文不仅给出了轻量实用的幻觉判别流水线,更量化展示了通用检测器在垂直领域的断崖式失效,并验证了判别信号反哺小模型 DPO 的闭环可行性。