arXiv 预印本Matthias Busch
分子基准测试中的“既视感”:前沿大模型逐位检索已发表实验数据
原标题:Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
论文82
大语言模型(LLM)越来越多地在分子性质基准上接受评估,但单纯的准确率无法区分一个模型究竟是在预测某种性质,还是在检索已发表的数值。我们对 22 个前沿模型在 12 个回归基准上的逐字检索(verbatim retrieval)现象进行了审查,发现该现象普遍存在,但相对具有基准特异性:在 5 个数据集上,超过 $50%$ 的 LLM 表现出逐字检索,而在其余数据集上,该现象仅在零星的单元中出现。我们在两个推理层级下进行了实验,发现推理会改变检索行为。针对相同分子并使用相同提示词的相同实验,在较高推理层级下被标记为检索的频率比较低层级高出 $89%$。最后,我们在污染最严重的情况下测试了一种阻断检索的方法,发现最强的模型在某些情况下仍能识别出经过变换的 SMILES 字符串与原始标签的组合。此外,抑制检索使不同模型之间的预测误差在相对层面上更加接近,而它们对逐字检索利用程度的差异则拉大了彼此的差距。这表明,LLM 的通用预测能力并不仅取决于其记忆数值的多寡。本研究全面概述了在使用 LLM 进行分子回归基准评估时,逐字检索现象的广度与深度。
为什么值得读
该研究量化了测试时推理反而诱发已发表实验数据检索的现象,为审视大模型在科学领域的真实泛化水平提供了警示。
标签
LLMData ContaminationAI for ScienceReasoningMolecular PredictionBenchmarkingarXiv