分子性质测试中模型的优异表现,有时只是对已有论文数值的逐位复诵。研究对 22 个前沿大模型在 12 项基准上的审计显示,超过半数模型在特定数据集中直接调取了已发表数字;开启更深层推理后,直接复述的频次甚至激增 89%。当剥离记忆的掩护,各模型的真实预测偏差明显收拢。
最近 24 小时暂无可用热度快照。